1B参数模型跑分接近7B, HRM-Text想重新设计计算
一个约1B参数的模型,在MATH上拿到56.2分,在GSM8K上拿到84.5分。这不是微调,而是从零开始预训练。

数字更惊人的是成本。16块H100跑了不到两天,训练消耗约1500美元。这是SapientIntelligence发布的HRM-Text,它挑战的正是行业默认的“更大更强”逻辑。
过去几年,大模型行业的增长几乎等同于规模的扩张。参数更多、数据更猛、算力更强,智能便会涌现。这条路当然有效,但也越来越像一场重工业比拼:烧钱、堆卡、拼工程。
但HRM-Text想试试另一条路:在有限的算力和数据下,能不能通过改变模型“怎么算”和“学什么”,来榨干每一分计算的价值?
论文标题直指核心:EfficientPretrainingBeyondScaling。

简单说,HRM-Text同时做了两件事。一是让模型在输出前,内部先“多想几轮”;二是训练时只关心最终答案,不让模型分心去“背题目”。
先看内部的计算。标准Transformer像一条流水线,信息经过一层又一层,最终输出。增强能力的传统做法是:加层,加宽,加参数。
HRM-Text走了另一条路。它在模型内部设立了两个运行节奏不同的模块:高层模块H,负责宏观规划,像项目经理;低层模块L,负责具体执行,像一线员工。

打个比方。传统模型是把一份材料依次交给十个编辑,每人改一遍就交差。HRM-Text是让两个小组(H组和L组)反复打磨同一份内部草稿,直到认为足够好了再输出。
这意味着,一个只有1B参数的模型,在吐出一个token前,可能已经完成了8轮内部迭代修正。参数没变,但有效计算深度被大幅拉高了。
当然,让同一组参数反复“循环”使用,稳定性是巨大挑战。练得越深,梯度越容易失控。HRM-Text为此设计了两道“保险栓”。
一是MagicNorm,在每轮循环结束时做一次归一化,稳住不断累积的激活值。二是渐进式“追责”,训练初期只让模型为最近2步计算负责,等稳定了,再逐步扩大到5步。
除了改架构,HRM-Text对训练目标也动了刀。传统模型是“下一个token预测”,无论输入是什么,都要学会接续所有文本。这很通用,但很多算力花在了“抄题”上。
HRM-Text只对答案部分计算损失。给它一段指令和回答,它只学习如何生成回答。


配合这个目标,它还用了PrefixLM注意力掩码。指令部分可以互相“看见”,形成整体理解;到了生成答案时,再切换回标准的“不能偷看未来”模式。
效果如何?消融实验看得最清楚。

以ARC-Challenge为例。一个标准1BTransformer得分为51.91。只改变训练目标(仅预测回答)后,跳到62.88。加上PrefixLM,到74.32。最后换上HRM架构,达到81.91。
三个改动叠加,缺一不可。它把模型的能力,从“泛泛而谈”拉向了“专注解题”。

这也解释了为什么它在MATH、GSM8K这类任务型基准上表现突出,但在MMLU这种广谱知识测试上并不领先。它更像一个“推理专家”,而非“百科全书”。团队也坦承,有限的数据和参数让它难以覆盖所有知识长尾。
未来的一个方向是,让这种擅长计算的“小脑”模型,与负责存储知识的“大脑”(比如检索系统或记忆模块)解耦合作。
这条技术路线,已经引起了顶尖学者的注意。就在HRM-Text发布后一天,图灵奖得主YoshuaBengio作为共同作者发布了新论文《GenerativeRecursiveReasoning》,其中的GRAM模型直接沿着HRM的分层递归路线,引入了更复杂的概率推理机制。


HRM-Text不是万能解药。它的推理成本因内部循环而比普通1B模型更高,向更大规模扩展时稳定性的挑战也会加剧。它不是否定Scaling,而是在证明,除了“变大”,还有“变巧”这条路可走。
在一个被规模定律深刻塑造的行业里,这种可能性本身就意味着新的起点。下一代智能的增长,或许不仅来自更多的参数与数据,也来自一个更根本的问题:模型究竟应该如何思考?