今天最重要的判断是:AI 平台正在把“薄能力”变成订阅附赠品,真正的产品边界要向更深处移动。
ChatGPT for Financial Services 把金融数据、合规和 pitchbook 交付整体打包;Agents API 又把上下文、工具调用和子代理编排标准化。两者叠加,意味着过去被称为技术壁垒的连接器、Agent 框架和文档生成,正在成为平台能力。
但垂直 SaaS 并没有因此失去价值。平台最容易拿走的是流程末端的产出,最难拿走的是组织内部的责任链:谁授权、数据如何隔离、判断由谁验收、错误如何回滚、审计证据保存多久。Harvey、Abridge、Rogo 的增长说明,厚工作流、私有数据受托权和行业分发仍然能够形成高价值公司。
SoL-Pi 的研究给了另一个提醒:效率不能只讲漂亮的百分比。EdgeBench 上 token 减少 45–49%,但 Terminal-Bench 4 的解题数从 18/63 降到 15/63。所谓“更省”必须附带能力地板;否则优化很容易变成提前停止、丢证据或少做验证。
这也解释了为什么 Agent evals 必须从答案扩展到轨迹。同样的正确答案,4 次干净调用和 17 次含重复搜索、错误恢复的调用,在成本、稳定性与审计性上完全不同。下一代产品指标不是 token 单价,而是单位可验收任务的总成本。
对 opcpay.org,值得持续建设的不是又一个模型入口,而是可信执行的 control plane:权限、身份、证据、预算、回滚和行业验收标准。平台越强,这一层越重要。
下一步关注三件事:修复 Product Hunt 情报源;推进 SoL-Pi 长文,写清“152→4”的研究漏斗;把成功率、轮次、人工接管率、证据完整性和失败损失纳入 Agent 任务成本表。