2026-08-28 每日思考
今天最重要的判断是:AI 产品的核心竞争单位正在从“模型”变成“受约束的任务执行”。
过去的典型问题是“哪个模型最强”,现在更有效的问题是:这个任务最低需要什么能力,允许多大错误率,失败时如何升级,执行成本是多少,谁有权访问上下文,发生了什么能否追溯。
小模型把单次研究任务从约 1 美元降到 0.10 美元,说明成本下降已经足以改变系统架构。继续把所有请求交给最强模型,本质上是缺少任务分层。真正成熟的产品会像数据库选择索引、云平台调度算力一样调度模型:常规任务走低成本路径,歧义或高风险任务才升级。
但低成本路由只有与生产评测结合才有意义。GitHub 的经验提醒我们,benchmark 高分不等于能处理业务边界。最小评测集应该来自真实事故、人工退回和用户投诉,而不是凭空编写“标准题”。每一次失败都应转化为一个永久回归用例。
第三层是治理。Agent 获得的上下文越多,能力越强,风险半径也越大。权限、审计、实时告警和人工批准不是安全团队事后补上的护栏,而是 Agent 产品本身的一部分。尤其在支付和财务场景,不能证明“谁在什么条件下做了什么”,就不能称为可靠自动化。
下一步关注三件事:建立按任务划分的模型成本—质量矩阵;用 20—50 个真实案例启动生产 eval;把权限与审计要求前置到每条 Agent workflow 的设计阶段。