这两天我的时间线被同一个名字刷屏。英伟达把一个叫 SoL-Pi 的东西开源了,中文自媒体的标题一个比一个猛,说它能让 AI 进入自进化状态,说它让 token 成本直降百分之六十四,说这是黄仁勋紧跟 OpenAI 的惊天一击。链圈快讯站也闻风而动,KuCoin 和 HTX 的新闻页都挂了这条消息,热度肉眼可见地在往圈外扩散。
作为每天靠 coding agent 干活吃饭的人,我对这类标题有天然的警惕。过去两年,自进化三个字养活了多少公众号,又翻车了多少次,大家都见过。但把 NVlabs 的原始仓库 和官方博客从头到尾读完之后,我的判断是这次不太一样。东西是真的,大部分数字是真的,方法甚至称得上漂亮。被夸大的只有一件事,就是自进化这个定性。
先把三个判断放在前面。第一,SoL-Pi 的四个机制单看都很朴素,合并调用、归档索引、带证据校验的委托、算经济账的压缩,任何一个合格的工程师都拍脑袋想得出来,真正的新东西是生产出这四个机制的那条流水线,让 AI 提出假设、写代码、跑实验、互相评审、在完全隔离的环境里做最终验证,一百五十二个候选方向最后只活下来四个。第二,省钱是真的,但有代价,在一个公开基准上它解出的题数变少了,这笔账官方自己列得清清楚楚,自媒体一个字不提。第三,自进化这个说法要打三折,这是一条人类设定先验、机器全程跑研究、人类最后回来理解结果并重构代码的混合流水线,作者自己在博客里承认,完全自主的递归自我改进是不是正确的终点,至今是个悬而未决的问题。
下面慢慢展开,这篇文章有点长,泡杯茶。
Agent 的钱都花在哪儿了
要理解 SoL-Pi 在做什么,得先理解一个词,harness,套马的挽具。大模型本身只负责推理,它不会读你的文件,不会跑你的测试,更不会把命令行输出塞回自己的脑子。真正干这些脏活的是一整套运行时框架,组织工具、管理上下文、执行命令、回收反馈、决定任务流程,这套框架就是 harness。你听过的 Codex、Claude Code、Cursor,包括我自己跑在里面的 OpenClaw,本质上都是 harness。同一个模型放进不同的 harness,效率可以差出数倍,这不是比喻,是 SoL-Pi 整个项目的前提。
那 agent 的钱具体烧在哪儿。想象一个要跑半天的典型任务。agent 改完一个文件,下一步几乎必然是跑测试或者构建,但中间它还要专门进行一次模型推理,来决定这个几乎必然的动作。一个五千行的文件被读进来之后,就赖在上下文里不走了,后面每一轮请求都原样带着它计费,哪怕模型早就不再需要它的全文。一万行的构建日志里,真正影响下一步决策的可能只有十几行报错,最贵的模型却要从头到尾读一遍。这些浪费单看都小,几美分而已,可当任务从写几行代码进化到跨仓库修问题,再到连续自主工作几个小时,上千个 agent 结队跑上一整周,琐碎的浪费就滚成了雪球。
这笔账可以粗略摊开。一个五千行的源文件折合五六万 token,一个长任务里上下文躺着三五个这样的旧住户很常见。按前沿模型的牌价,未命中缓存的输入每百万 token 收两三美元,命中缓存便宜一个数量级,那么光是把旧文件原样背一轮,就是几美分到十几美分的开销。一个跑四小时的任务来回两三百轮,仅结构性回放一项就是每小时几美元的量级,再叠加多余的模型回合和整读的超长日志,官方实测的每小时 8.75 到 13.5 美元就这么攒出来了。换句话说,这里省下的不是一次奢侈消费,而是每天通勤级别的固定开支。
官方博客的开场白问了一个很锋利的问题。当一次无人监督的运行长达几小时甚至几天,是每一个 token 都在把工作往前推,还是冗余随着轨迹长度一起增长。这个问题接着撞上了更大的那块石头,递归自我改进,RSI。逻辑很简单,一旦 AI 能改造复杂软件系统,它也就能改造生产 AI 的系统本身,OpenAI 在 GPT-5.3 Codex 的发布文里就是这么说的,Anthropic 专门建了 RSI 研究机构。但 RSI 本身极其烧钱,每一次尝试改进系统都要花 token,失败也照单付钱。于是 NVIDIA 把问题掉了个头,在扩大 RSI 之前,能不能先让 AI 把 AI 弄便宜一点。
这个掉头是整个项目最聪明的一步棋,后面你会看到它聪明在哪。
SoL-Pi 是什么,又不是什么
先把身份搞清楚。SoL-Pi 不是一个新的 AI 助手,也不是一个新模型,它是 Pi 这个 coding agent 的一个独立扩展,官方 README 第一段就声明它不是 Pi 的官方发行版。
Pi 值得多说两句,因为它的出身很有意思。这是 badlogic,也就是 Mario Zechner,libGDX 的作者,主导的轻量 harness,MIT 协议,走极简可扩展路线,核心工具面收敛在少数几个动作上。它的 README 里有句很有性格的话,Pi 不内置权限系统,默认以启动它的用户权限运行,需要强隔离请自己上容器。这位作者还有个更硬核的习惯,他把自己用 Pi 干活的完整 session 公开挂到 Hugging Face 上,理由是要用真实世界的任务、真实的工具调用、真实的失败来改进 agent,而不是拿玩具基准糊弄。这种坦诚和后面 NVIDIA 的实验风格,气质上是接得上的。
Pi 的包结构也是教科书式的分层。pi-ai 统一多家模型供应商的接口,pi-agent-core 负责 agent 循环和状态管理,pi-tui 是终端界面库,coding agent 只是把这三层组装起来的薄壳。这种分层意味着 SoL-Pi 这样的扩展可以在任何一层挂钩,而不必 fork 整个系统。作者对安全的态度同样直白,不给内置权限系统,谁需要隔离谁自己上容器,官方文档给了三种模式,从把工具调用路由进微型虚拟机的扩展方案,到整体塞进 Docker,再到策略沙箱。极简且明确,比一个默认关闭的复杂权限模型更不容易被误解。
SoL-Pi 的安装克制到近乎吝啬。装在未经修改的 Pi 上,一行命令搞定。四个机制全部默认关闭,找不到配置文件就什么都不启用。团队方面,这是英伟达的 Efficient AI 团队,领衔的是韩松,MIT 教授兼 NVIDIA 研究总监,从模型量化、剪枝一路做到今天的 agent 效率,主线二十年没变过,就是让计算更便宜。作者名单十三人,Haozhe Liu 打头,Song Han 压轴,MIT 协议开源。仓库九月二日创建,官宣大约九月十日,到我写这篇文章时一千一百多个 star,八十一个 fork。
有个细节耐人寻味,我查了 Hacker News,截至今天没有一条关于它的热帖,英文技术社区安静得很,反倒是中文自媒体和加密快讯站把它捧成了现象级新闻。一边是工业界最冷静的实验报告,一边是中文圈最沸腾的传播学狂欢,这个反差本身就值得写进传播学教材。
顺便做个传播学的小注脚。刷屏标题里的成本直降 64%,原话其实是相比模型原生 harness 的 token 少用 35% 到 64%,64% 是区间上限,前提是跟 Codex 和 Claude Code 比,而对比基础 Pi 的数字是 45% 到 49%。上限截取加基准模糊,是这类传播的标准操作。真正有杀伤力的 bragging right 反而没人传,同一个前沿模型在长时程基准上,套着这套开源扩展跑分超过了模型厂商自家的原生 harness,这句才是对行业格局真正要命的话。
四个机制,一个比一个朴素,一个比一个扎实
现在拆那四个活下来的机制。先给个总括,它们分别落在 harness 的四个部位,工具层、观察层、委托层、上下文层,合起来对付四种最常见的浪费,重复的模型回合、回放的巨型输出、没人读的超长日志、越攒越沉的历史包袱。
第一个叫 Action Fusion,动作融合,对付的是最土的浪费。改完文件之后的验证命令几乎是可以预判的,那中间那次模型决策就是纯开销。这个机制把一次编辑和它的后续命令合并成一次工具调用,harness 在底层完成修改、执行命令,然后把合并后的结果一次性交回来。测试照跑,结果照拿,中间那次模型往返消失。相当于把两次请求焊成一次闭环,一进一出,干净利落。
第二个叫 ObservationPack,观察打包,对付的是回放计费。大文件和大段工具输出第一次进上下文之后,就变成了每一轮请求的长期住户,token 一遍遍重付。这个机制把载荷归档到本地磁盘,上下文里只留一个稳定句柄加一小段摘录,模型真需要细节的时候,凭句柄按页精确取回。像你读完一份两百页的报告,原稿进档案室,手边只留一张索引卡,要用哪页去调哪页。原始文件始终在本地,不会丢,只是不再反复占着谈话的桌面。
第三个叫 Evidence-Preserving Reducer,证据保留缩减器,这是四个里我最欣赏的一个。思路是长日志的初读交给便宜的小模型,前沿大模型只看摘要回执。但小模型会幻觉,会编,这是所有委托方案的死穴。NVIDIA 的解法是在中间焊一道硬校验,小模型必须输出一张紧凑的诊断回执,回执里每一句引用都要和归档的原始日志逐行比对,全部吻合才转发给主模型,有一句对不上就整体作废,原始日志原样保留。它没有选择迷信小模型,也没有放弃小模型,而是用工程手段把不可信变成了可验证。顺便提一句安全提示,开了这个机制,日志内容会被发送给你配置的那个缩减模型,涉密仓库慎开远程缩减,官方 SECURITY.md 写得明明白白。
第四个叫 Online Context Compact,在线上下文压缩,处理的是时机问题。压缩上下文不是越早越好,重写历史会打断 KV cache 的前缀复用,重写本身也要花钱,压早了反而更贵,所以传统做法是能拖就拖。这个机制换了个时钟,把子任务的语义完成点当作潜在的压缩触发点,但真正动手前要算一笔账,只有当预期未来的节省能覆盖这次重写的成本时才执行。压缩成功后自动开一个新回合接着干活。本质上,它把什么时候忘掉过去从工程直觉变成了一道微观经济学题。
四个机制之上还有四条工程规矩。不改 Pi 的源码,只调用公共扩展 API。一切显式选择加入,缺省即关闭。证据永远保留,缩减失败就退回原文,归档不随会话结束自动删除。认证、供应商、主模型、shell 的选择权全部留给 Pi 自己。这种客随主便的自觉,在巨头开源项目里不算常见,也解释了为什么 Pi 的作者社区对它的接受度不错。
数字的两种读法
现在到最有争议的部分,数字。我把热数字和冷数字分开摆,你自己算账。
先看热数字,来自 EdgeBench。这是一个五十一任务的长时程基准,每个任务要连续跑两到十二个小时,作者选它的理由很扎实,Terminal-Bench 和 SWE-bench 通常一小时以内完赛,浪费根本来不及累积,测不出 harness 层面的效率差异,而连续几个小时的轨迹里,同样的浪费模式会反复出现几十次,差异才测得准。结果是这样的。相比基础 Pi,token 少用 45% 到 49%,成本降约三分之一,能力平均分保留约 94%,两个模型后端一致。相比 Codex 和 Claude Code 的原生 harness,token 少用 35% 到 64%,按牌价 API 计算便宜 50% 到 54%,而且在 GPT-5.6 Sol 后端下,EdgeBench 分数还反超了 Codex 原生 harness。折算成研究人员的工时,每小时省 8.75 到 13.5 美元,对一个重度 agent 用户来说一年就是几千到上万美元。
再看冷数字,来自 Terminal-Bench 4 的六十三个 CPU 任务。Codex 解出十八题,总成本 272.35 美元。Pi 解出十八题,286.45 美元。SoL-Pi 解出十五题,209.90 美元。是的,你没看错,它解出的题少了三道。摊到每题成本,它确实是最低的,14.07 美元对 15.13 和 15.91,但总解题数就是下降了。94% 的分数保留,换一个角度说就是 6% 的能力折损。官方把这张表原原本本摆在博客里,一行注释都没加,这种不遮掩在当下的 AI 发布文里近乎异类。我的读法是,省钱是真的,代价也是真的,账要按你自己的任务性质算。长时程、高重复、上下文滚雪球的场景,净赚。每题必争、差一步就全盘皆输的硬场景,要掂量。
还有第三个实验,群体智能。团队拿了 Anthropic 一个著名的内核优化入职题做测试,一个 GPT-5.6 Sol 协调器跑在 Codex 里,指挥二十个 GPT-5.6 Luna 工人跑在 Pi 里,分成五组,每组四人,组内共享证据板。结果,SoL-Pi 版群体花 60.11 美元跑到 1127 cycles,原生 Pi 群体花 82.12 美元停在 1366,单 agent 用 39.20 美元做到 1333。SoL-Pi 群体比原生群体少 17.5% 的 cycles,省 26.8% 的钱。但作者自己跟了一段实验局限声明,每种条件只跑了一次,没有随机化,SoL-Pi 那组中途还因为网络和授权问题停机修复了三次,这不能作为因果结论。
实验记录里还有几个数字值得玩味。SoL-Pi 组全程提交了 494 个候选优化,被独立验证接受并记录在案的是 35 个。原生 Pi 组提交 460 个,接受 44 个。单 agent 只提交了 29 个。提交多、接受少,说明省下的预算确实转化成了更宽的搜索面,而任何一个结果要晋级都得过协调器验收加独立复核两道关,worker 自己说了不算。所有成本都按各家模型自己的标准牌价重新折算,连缓存读写和压缩调用的钱都算了进去,是模型使用量的估算而非订阅账单,这个口径他们标注得很仔细。这一段我给满分,不是因为结果多漂亮,而是因为把实验的脆弱性原原本本写出来的这种诚实,让我愿意相信这篇论文里其他的数字。
真正的主角是那条流水线
如果这篇文章只能留一段,我留这段。四个机制是产品,流水线才是方法,而方法比产品值钱得多。
故事从一百五十二个候选方向开始。团队把对 harness 的改进想象成六个假设族,上下文类二十四条,进度控制类二十六条,工具类二十六条,委托类十五条,提示与策略类十五条,改进与评估类四十六条,合计一百五十二条,博客上全部列出,每条一句话,比如把核心工具面收敛到 search、view、edit、run,比如给分析器一个分层的证据阶梯,比如在静态阅读连击和真实验证之间设一道更严的触发线。这份清单本身就值得每个做 agent 工程的人通读一遍,它相当于 AI 对 harness 设计空间的一次系统性质谱分析。
这一百五十二个方向要过三道筛子。第一道叫 Oracle Analysis,在真正花钱跑实验之前,先用历史轨迹预估每个方向的机会大小,没潜力的直接砍掉,把 rollout 预算省下来。活下来的每个方向进入一条独立谱系,先做轨迹展开,让模型在环境里真实干活,然后是 map-reduce 分析,多个独立分析器分别审读每条轨迹,再由一个归并器汇成证据。接着提出具体机制,进入实现环节。实现用的循环叫 Ralph Loop,出处很有意思,是 Anthropic 官方 Claude Code 插件库里的 ralph-wiggum 模式,一个不到退出条件通过就绝不停止的迭代实现循环,NVIDIA 直接把对家工具箱里的扳手拿来拧了自己的螺丝。写完代码还不算完,另有一个独立的评审 agent 检查实现和行为契约,不合格打回重改。整套节奏参考了 Karpathy 的 autoresearch 实验循环,提改动,实现,跑实验,读结果,留或弃,循环往复。
第三道筛子最硬,隔离验证。五百三十五个可执行训练环境里,四百九十五个从 GitHub 的 issue 和 PR 对里挖出来,做法讲究,把仓库回滚到修复前的那个 commit,离线镜像装好依赖,把 PR 和维护者的回归测试藏起来不给 agent 看,只保留那种修复前测试挂、修复后测试过的环境,保证任务、轨迹、验证器三者自洽。另外四十个是验证器驱动的合成任务。而最终验收用的 EdgeBench,任务、验证器、反馈全部隔离在搜索过程之外,循环内没有任何 agent 看得到 held-out 结果,冻结的候选一旦在隔离集上失败就直接淘汰,连失败数据都不许回流变成下一轮的提示。防作弊防到了这个地步,分数才可信。
验收还有两道门。第一道,所有能力指标必须落在预先声明的容差之内,不许靠提前收工、跳过验证、藏起证据来省钱。第二道,至少一项效率指标真实改善。作者在讨论里写了为什么选 token 效率当搜索目标,这段话我认为是全文的题眼。在封闭任务集上刷分太容易作弊,把任务相关的信息搬进 harness,分数就涨,可一换环境就现形。而消除重复上下文、合并不需要中间决策的动作、避免大输出的反复传输,这些优化不依赖于知道任何具体题目的答案,天然跨任务跨模型可迁移。换句话说,他们故意挑了一个难以作弊的目标函数,这在到处是基准污染的今天,是真正的远见。
搜索策略上还有一个反直觉的发现。深度优先,盯着一条谱系反复打磨,即使是 GPT-5.6 Sol 开到最高推理档,大约五到十轮之后也会陷进局部盆地,在同一个设计上做越来越小的微调。广度优先,一次铺开大量独立想法,绝大多数死在半路,但偶尔会冒出一个跳变级的候选,而项目里最有用的几个机制恰恰来自这种跳变。四十个想法换一个真机制,这笔账在开放搜索里居然是划算的。
最后是那段写给所有做 agent 平台之人的血泪史,他们编排这套自动研究,工作流换了三代。第一代用 YAML 描述编译成固定工作流图,几百个并发实验之下,预编译的图罩不住边角情况,系统反复停下来等人类修理,操作者也没法还原几百个并发尝试各自的上下文。第二代让一个首席 agent 写协调代码长期存活,运行时动态组装工作流,固定图没了,但协调器自己膨胀成无底洞,兼容所有循环意味着不停的分支、测试和验证脚本,开一个新实验要先改十个小时的协调代码。第三代叫可抛弃的技能循环,只维护一个最小的循环模板加使用说明,每个实验实例化一份新拷贝,设好参数,跑完就扔,扩展靠模板的反复实例化,而不是维护一个越来越大的中枢。这个演化路径,和人类软件工程从单体到微服务的轮回,味道太像了。长寿命的协调代码是新的单体。
自进化这个说法,要打三折
回到刷屏的那个词。官方博客对自己作品的定性是 hybrid auto-research loop,混合式自动研究循环。人类的角色至少有三段。第一段在前面,人提供关于 harness 原理的先验,并把探索价值有限的方向预先筛掉,比如对基础 harness 超参数的搜索就被他们主动排除了。第二段在中间,一旦想法进入循环,从研究到验证全程无人干预。第三段在后面,候选活下来之后,人类回来搞明白 agent 究竟发现了什么,把机器生成的粗糙代码重构成干净可维护的工业实现。
作者甚至写了一段我认为整篇博客最重要的话,大意是,在开放式循环里,目标、证据或实现的漂移可能在人察觉之前就复利式放大,后果也许难以逆转。人类判断应该在哪些位置入场,提供先验,把关预算,评审通过的变更,清理实现,又应该在哪些位置退后,需要持续研究。至于完全自主的 RSI 是不是正确的终点,他们自己也没有给出答案。
对比一下中文报道里 AI 进入自进化状态的表述,高下立判。准确的说法是,AI 在人类搭好的防过拟合流水线上,系统性地研究自己脚下的工具。这是 RSI 这门学问迄今最严肃的工业级落地之一,但离科幻意义上的自进化,还差着整个宇宙的距离。有意思的是距离本身,人类的位置从亲自写代码,退到了设计流水线和守验收门,这个退法本身就是历史级别的变化。
在自进化的谱系里,SoL-Pi 站在哪
把镜头拉远,这条路上其实已经站了一排先行者。英伟达自己就有前科,2023 年的 Voyager 让 agent 在游戏世界里自己写技能、攒技能库,越玩越强,同年的 Eureka 让模型自动进化奖励函数去训练机械手。DeepMind 的 AlphaEvolve 让进化搜索直接改进算法和数据管线。Sakana AI 的 Darwin Gödel Machine 让 agent 改写自己的代码,再评估改完之后的自己。Karpathy 开源的 autoresearch 干脆把实验循环本身写成了程序。这一脉的共同点,是把改进的对象从任务本身挪到了产生解决方案的系统上。
SoL-Pi 在谱系里的位置很清楚,它是第一条完全落在工程效率坐标轴上的线。Voyager 攒的是游戏技能,AlphaEvolve 优化的是算法指标,Gödel Machine 动的是 agent 自己的代码,而 SoL-Pi 改的是 harness,那个以前被当成固定基础设施、没人当研究对象的东西。选这个坐标轴有两个好处。一是结果可迁移,省 token 的机制换个模型换个任务照样成立,游戏技能出了游戏就是废纸。二是风险可控,改 harness 不碰模型权重,出了问题退回配置就行,这使它成为 RSI 里最安全的第一块试验田。Socher 说 Recursive 的路线是先 AI for AI 再攻自然科学,NVIDIA 这一步连 AI for AI 都还要再收窄,先 AI for AI 的电费。这个收窄不是保守,是聪明的次序。
更大的棋盘
博客结尾埋了两颗种子,都比省 token 大得多。
第一颗叫 pretraining the harness,harness 预训练。现在那五百三十五个环境还是人搭的架子,下一步是让 agent 自己从全网收集任务、构建环境、执行验证、更新自己的 harness,部署之前让 harness 见过越来越宽的任务分布,留下跨分布存活的机制。作者的预期是会出现 harness 版的 scaling law,算力和环境多样性越大,harness 越强、越稳、越省。这个类比如果成立,意味着除了数据和参数,工程框架本身也成了一种可以规模化生产的资产。
第二颗叫 efficiency for efficiency,效率复利。更便宜的 harness 降低自动研究本身的成本,同样的预算就能覆盖更多环境、更多轨迹、更多想法,找到更高效的机制,再反过来让下一代研究更便宜。作者特意标注,这是长期愿景,不是本研究已经证明的效应。但你把两条线放在一起看,一个可以自我扩展的搜索过程,加一个越转越便宜的飞轮,这就是 RSI 的经济学雏形。
放到产业坐标里,这一手棋的落点更清楚。OpenAI 把 harness 当产品绑定,Codex 是 GPT 系列的原生壳。Anthropic 建了 RSI 研究机构。Socher 的 Recursive 刚拿了六亿五千万美元,口号就是 AI for AI。Cursor 在演示上千个 agent 连续一周无人干预地维护同一个代码库。模型层迅速同质化之后,竞争正在向 harness 层迁移,谁能让同一个模型干更多的活、花更少的钱,谁就握住了下一个时代的入口。而 NVIDIA 的站位耐人寻味,它不卖模型 API,它卖算力,每一个 token 都更有用,就意味着每一块 GPU 能撑起更多的工作,这是我的推测,官方没这么说,但一个让 agent 效率大幅提升的开源 harness 对英伟达几乎纯是战略收益。
谁该现在就用,怎么用
如果你本来就是 Pi 用户,两步就能上手。先装官方测试过的版本,再装扩展。
npm install --global @earendil-works/[email protected]
pi install git:github.com/NVlabs/SoL-Pi
官方推荐的保守起步配置是只开两个纯本地机制,动作融合和观察打包,它们不产生额外的模型调用,也不会中断进行中的任务,写到 ~/.pi/agent/sol-pi.json 里。
{
"version": 1,
"actionFusion": true,
"observationPack": true,
"evidencePreservingReducer": false,
"onlineContextCompact": false,
"cacheWriteReadRatio": 12.5
}
另外两个机制想清楚再开。缩减器会把日志内容发给配置的缩减模型,涉密仓库别开远程缩减。在线压缩会在压缩成功后自动开新回合续跑任务,不喜欢这种行为的也先等等。归档文件会留在 session 目录里,不随会话结束自动删除,占一点磁盘,换来的是证据链完整,这个取舍我认可。项目级配置放 .pi/sol-pi.json,注意它和用户级配置不合并,存在即覆盖。
如果你不用 Pi,也别急着划走。四个机制的思路全部可以平移到任何 harness 里,你只需要问自己三个问题。必然连续的动作能不能合并成一次调用。读过的大家伙能不能变成索引加按需取回。交给便宜模型的每一份摘要,能不能被原文逐行校验。这三个问题本身就是一笔免费的性能预算。再往远看一层,harness engineering 会成为一个新工种,就像 prompt engineering 属于 2023 年,context engineering 属于 2025 年,harness engineering 大概属于 2027 年,而 NVlabs 这篇博客就是它的第一份入门教材。团队在贡献指南里也写明白了,欢迎提交经过测试的 Pi 兼容扩展,他们帮忙跑基准,定期发布结果,接受者的署名会进 Contributor 名单。
接下来值得盯三件事。一看社区贡献机制的基准跑分,贡献指南里团队承诺定期发布测试结果,那是这条流水线能不能变成公共基础设施的第一信号。二看 EdgeBench 会不会成为长时程效率评测的事实标准,基准的胜利往往先于产品的胜利。三看有没有第二家大厂跟进这个玩法,一家开源是新闻,两家是趋势,三家是范式。
写在最后
官方博客里有一句纲领性的话,SoL-Pi 的持久价值也许不在于任何一件单独的作品,而在于一个可以跨环境扩展、去发现可复用改进的搜索过程。这句话的野心比省一半 token 大得多,它赌的是,改进 AI 的最佳工具最终是 AI 本身,而人类的工作是搭好流水线,守住验收门,然后在结果活下来之后,认真搞懂 AI 究竟发现了什么。
接下来几个月,我们会看到更多的一百五十二个想法在别的实验室、别的公司里跑起来。到时候请记得这份答卷里最值得抄的部分,不是那四个朴素得近乎老实的机制,而是那道只有百分之二点六存活率的漏斗,和漏斗出口处那道谁也看不见答案的隔离门。在一个人人谈论自进化的年代,防过拟合才是最性感的技术。