—— 开放的知识共享平台

1位菲尔兹奖得主+12位博士,这些俄罗斯数学家训出了顶级AI

首页 > 头条采集 > 1位菲尔兹奖得主+12位博士,这些俄罗斯数学家训出了顶级AI

我看到 Mostik 这事儿的时候,第一反应真是:这是谁啊,哪里冒出来的一群俄罗斯数学家,竟然把 GLM 和 Qwen 当“积木”一样往一起一拼,就在 ARC‑AGI‑3 上干到接近 GPT‑6 Astra 的水平,而且核心招数还是“不给你看细节,因为比赛还没完”。这操作,很典型的顶级科研团队气质:我能说的都不是最狠的。

行吧,Mostik 这波,确实有点东西。

先把结论说前面一点,方便你决定要不要往下看:

1. 12 个博士加一个菲尔兹奖得主,4 个月做出来一个“模型之间直接用隐藏状态交流”的方案,小模型补上大模型半档能力,成本砍到二十分之一,这事儿是真的颠认知。

2. 这跟我们平时用的大模型、端侧小模型、算力焦虑,是一条线上的:以后不一定非得堆一个超级大模型,完全有机会搞“模型群协作”,靠桥接把能力拼出来。

3. 对华为这种整机厂和体系厂来说,这路子其实非常对胃口:一边麒麟端侧小模型,一边云端大模型,中间靠“桥”走隐藏状态,比现在纯文本 API 聊天高效太多。

下面我分几块聊,但不按教科书那种顺序,容易困。

一、先看“离谱成绩”:4B 小模型,硬吃半个 753B 大模型的灵魂

Mostik 放出来的 demo 很简单粗暴:

1. 角色分工

GLM‑5.2:7530 亿参数,巨无霸,在云端,只负责“看题、思考”,不写字。

Qwen‑3.5:40 亿参数,小模型,可以往手机上塞,只负责“提笔写答案”,像个秘书。

2. 工作流程

大模型读完题,在自己脑袋里一顿算,产生一坨 2MB 级别的内部隐藏状态。

这些状态不转成文字,直接丢给一个训练好的“桥”进行转换。

桥翻译成小模型能读懂的内部向量,小模型拿来直接继续思考,顺势把答案写出来。

整个过程,大模型一个 token 都不用输出,连个“思维链”都懒得写。

3. 数据效果

官方公开的大致数据是这样:

Qwen 原本和 GLM 差一大截,桥接之后,Qwen 补上大概 50% 的差距,整体准确率提升约 25%。

难题子集上,Qwen 的表现最高能翻到原来的 2 倍。

这套混合系统的运行成本,是“让 753B GLM 从头到尾自己搞定”的约二十分之一。

换个算账方式:假如有一个中等大小的模型,成绩刚好跟这套组合差不多,那 Mostik 组合所需算力,大概只有它的 40%。

这数字对实战意味着什么?

你可以想象:手机里放一个 4B 小模型,云端挂一个 700B 级大模型,不用每次都让云端辛辛苦苦写完答案,只让它“看题思考一下就下班”,手机本地把话说完。

对用户来说,响应更快,流量更省;对厂商来说,算力账直接好看一截。

二、为什么“桥”能生效:原来模型真正聪明的部分,平时都被你丢掉了

这波最关键的认知,是 Mostik 给那笔“2MB 对 17 比特”的账。

他们的说法很形象:

1. 模型内部有多“吵闹”

一个大模型,为了生成一个 token,内部会构建一百多个隐藏向量,大概一百万个数值,接近 2MB 内部状态。

这里面记录的是:

当下对问题的理解

正在考虑的概念

后面准备往哪个方向写

这些都是“脑内活动”。

2. 真正吐出来的东西有多寒酸

模型输出时,只能在 15 万个词里选一个 token。

一个 token 携带的信息,大概 17 比特。

简单点说:一个在上千维空间里思考的大脑,最后只能对外挤出一个小小的词。

那 2MB 的内部状态,直接被扔进垃圾桶。

多智能体、CoT、模型委员会、工具调用这些玩意,全都在这 17 比特上打转。

3. 损失的到底是什么

过去很多人把“隐藏状态”当脚手架,觉得写在纸上的词才是成品。

最近两年一堆可解释性研究在打这套旧认知的脸:

Qwen‑3 写 “an accountant” 的实验:

模型在真正输出“accountant”这个词前几个 token,内部已经形成这个词的清晰表征,所以它能提前选对冠词“an”。

Anthropic 在 Claude 3.5 Haiku 上看到:

写诗时,先在内部确定好韵脚,再反推前半句。

还有“J‑space”那类工作:模型在内部维护一小组“没说出口的概念”,哪怕后面生成的文字压根没提,这些概念也会在隐藏层里继续存在一段时间。

这些一起指向一个事实:

模型写出来的字,只是内部计算的一小块切片。

真正让它做对选择的过程,一般都死在隐藏状态里了。

所以你现在再看 Mostik 搭的“桥”,就有点味道了。

三、桥本身在干嘛:两个不兼容大脑间,硬生生凿了个“数学翻译层”

Mostik 的设计思路其实挺工程化的,概括一下就是:

1. 冻结两边模型

GLM 不改,Qwen 也不改,权重完全不动。

只训练中间那块“桥”。

这一点很关键,意味着你可以把任意两个模型当黑盒,只要能读写隐藏状态,就能通过训练映射,把它们“接起来”。

对闭源大模型厂商来说,这个思路也很友好,不用开放权重,也不用配合别人给自己再训一遍。

2. 难点在于“内部几何不一样”

不同公司、不同架构、不同训练数据下的模型,在自己内部空间里,哪怕表达同一个概念,在向量空间里的位置、形状都可能完全不同。

你可以粗暴理解成:一个用俄语在想,一个用中文在想,但都没有字幕。

菲尔兹奖得主 Smirnov 其实就是盯着这事干的,他们先研究各种模型内部空间的几何结构,发现虽然整体风格差别很大,但还是存在一部分可以预测的共同结构,可以被映射。

3. 桥负责的就是“数学翻译”

大模型做完一段计算,把自己的隐藏状态吐给桥。

桥通过训练,学会哪种隐藏模式,对应小模型那边的哪种状态。

小模型拿到这坨翻译后的状态,相当于瞬间被“塞了一脑子上下文理解”,可以在比原来高的位置继续思考。

这个桥,本质上是唯一需要算力训的组件。

这事有几个现实好处:

1. 更换大模型或者小模型,只用重训桥,系统架构不用推倒重来。

2. 大模型厂商可以出一个“隐藏状态 API”,不需要改自己训练流程。

3. 对开源生态尤其友好,大模型、小模型都可以由社区维护,桥则做成可叠加的组件。

四、什么时候桥优势最大:越早交接,越赚

Mostik 自己也做了个非常接地气的对比实验:

“隐藏状态接力”对比“文字接力”。

规则类似:

大模型先算一段,再把任务交给小模型。区别只在于交接内容是文字,还是隐藏状态。

测试结果,大致可以总结成三句话:

1. 所有算力档位上,隐藏状态接力都比文字接力表现更好,优势最多能拉开 10 个百分点。

2. 大模型越早把任务交出去,隐藏状态方案的优势越明显。

原因很简单:一开局大模型还没写字,文字交接几乎无物可传,但内部状态里已经装满对题目的初步理解。

3. 给大模型越多算力,两种方案的差距会慢慢缩小,因为大模型开始在文字里暴露越来越多内部判断,不过隐藏状态这边仍然是“性能和成本综合比”更优。

放到实际产品上怎么理解?

比如你在手机上开一个 AI 助手,提出一个复杂问题。

云端大模型看题三四百 token,瞬间脑内跑一堆推理,把中间状态丢回来,本地小模型接着写。

如果你只用文字接力,那云端要先把这三四百 token写成提示词,小模型再读一遍,每一段都要经过 I/O、水管、解析,成本和时延全上去。

用桥的话,云端大模型从头到尾“一个字都不说”,只管思考,算完就散,人类只感受到“这小模型怎么突然变聪明了一截”。

五、这玩意对“顶级 AI”意味着啥:单体大脑不一定是终局,一群模型抱团才可怕

Mostik 自己博文里有一个观点,我还挺认可的:

过去几年,AI 性能提升主要靠两条路走:

1. 预训练堆数据、堆参数,把世界知识塞进一个模型里。

2. 推理阶段加算力,加 CoT、树搜索、工具调用,让一个模型思考得更细致。

他们押的是第三条路:

“模型之间高效协作”。

单个模型不用什么都自己干,只要能把内部真正有价值的信息“高带宽”地交给别的模型,一群中等体量的模型,也可能拼出接近 SOTA 的效果。

这点对开源社区是非常关键的:

1. 开源世界里散落着一堆小模型,中文好的、代码强的、多模态强的,但各有所短。

2. 如果它们之间可以共享隐藏状态,就不是“弱弱相加”,而是真正有机会做“强强互补”。

3. 参数量不再是唯一的战力衡量标准,开放接口、桥接能力、本身那些“未说出口”的内部计算质量,会变成新的关键指标。

Mostik CEO 用那个“猜猪重量”的比喻挺贴切:

一群普通人报数取平均,有时候比一个专家更准。

现在多模型如果只用文字协作,相当于大家都是先把脑子砍成 17 比特再丢给别人。

桥做的事,就是尽量保住那 2MB 里的有用部分。

六、跟华为、小米这种“端云协同”厂商有啥关系

我这边平时看手机圈、操作系统圈多一点,这件事往回拽,跟国内厂商其实是直接相关的,尤其是这种“自家芯片加自家系统”的玩家。

你看 Mostik 的这套组合:

云端:一个超大模型,只做阅读和思考,暂停在中间状态。

端侧:一个轻量模型,负责对话、生成、跟用户交互。

中间:一个桥,把两边内部空间打通,高效传递“脑内结果”。

这个结构和国内很多公司的战略拼图是高度贴合的。比如:

1. 麒麟芯片加鸿蒙的那套“端侧 AI + 云侧大模型”的故事,如果只靠文字拼接,很多细致的推理、偏好习得、上下文理解都会在传输时损失。

2. 假如鸿蒙给自家端侧模型预留隐藏状态接口,再在云端大模型那边允许输出中间状态,就有机会做类似 Mostik 的桥接。

3. 华为经常强调“端云协同、软硬协同”。端这边的算力再强,手机上也塞不下 700B 这种级别的大模型,但可以塞得下一个小型推理模型配合 NPU,把云端的“高级智能片段”实时接力下来。

这里我稍微替国内厂商说一句现实话:

这种桥接要真落地,难点不在算力,而在“敢不敢开放”和“敢不敢标准化”。

1. 云大模型要对外暴露一部分隐藏状态接口。

2. 端侧模型和云侧模型最好有统一或可转换的内部表示规范,不然桥的训练成本会被架到很高。

3. 这里面还有隐私和安全问题:隐藏状态里有多少可逆信息,会不会泄露用户输入,会不会被用来逆向模型本身,这是后面一定绕不过去的。

但话说回来,只要有一家把这条链子打通,体验差距会非常直观。

你可以想象一个场景:

你在手机上用 AI 写代码,云端大模型只负责理解整个项目仓库、规划 refactor 方案,把隐藏状态反向灌给手机本地小模型,本地就能边离线补全边智能改代码。

纯云端就算更聪明,遇到网络一抖,全体验直接崩。桥接方案,本质上把大模型的“高智商状态”抓下来,让小模型在你设备上“带着大脑残影”跑起来。

七、冷静一点:现在吹太满也不合适,有几个坑还没填

把话说得好听很容易,我这块也得泼点冷水。

1. 目前绝大部分结果,都是 Mostik 自己披露的,自家测试集、自家评估标准为主,ARC‑AGI‑3 的正式技术方案还没公开。

外部团队能不能稳定复现、能不能在别的任务上同样有效,这都需要时间验证。

2. 桥的泛化问题其实挺吓人:

换一对模型,要不要从头训桥?

桥的训练数据、训练成本会不会反过来变成新的门槛?

不同架构(比如 MoE、RNN、Transformer 变种)之间的内部表征,能稳定映射吗?

3. 安全和商业现实

对闭源大模型厂商来说,隐藏状态是非常敏感的资产,直接暴露接口意味着更多攻击面。

跨公司传输隐藏状态的时候,怎么做加密、匿名化、隐私保护,都是实打实的工程难题。

4. 解释性那块,Mostik 自己也很克制,说现在谈“可解释工具”还太早,只是多了一块可以观测和干预的新区域。

真正要做到“把某个向量方向对应到人能理解的概念”,还是一条很长的路。

所以我自己态度比较中间:

这条路明显值得押注,但离“工业界标准做法”还有一段距离。

考虑到团队配置和 ARC‑AGI 的成绩,我更倾向于相信他们有真货,只是现在你我能见到的还只是冰山上面一角。

写到这儿差不多了,收个尾。

我觉得,Mostik 这波,真正敲在行业脑门上的问题,不是“俄罗斯数学家多牛”,而是一句简单的话:

既然大模型脑子里真正有价值的东西,远远多于它写出来的字,那我们为什么还要逼着 AI 用文字互相聊天?

未来更强的 AI,很可能不是一个 10 万亿参数的超级大脑,而是一群风格各异的模型坐在一起,表面啥也没说,内部隐藏状态已经交流完一整套“数学心电感应”。

你怎么看这条路子?

你更期待的是:

把一个超级大模型越做越大,还是用一堆中等模型加“桥”的方式拼出整体智能?

如果让你选,手机里内置一个强一点的小模型,按需“借脑”云端大模型,和现在纯云端 API 调用比,你更愿意用哪种?

留言说说你的看法,我后面可以再结合华为、苹果这些端侧 AI 的路线,单独拆一篇“桥接式端云协同”聊聊。