概述

2026年8月,Anthropic对外披露了一组内部研发平台核心度量数据:在其主力研发平台上,同一时刻有约30000个AI Agent并行开展研究与工程任务,其中Claude已经自主主导了26%的AI研发相关工作。同年9月17日,Anthropic正式发布改版后的Claude Projects,将这套在内部3万Agent集群中验证成熟的多Agent协同、并行任务调度与共享记忆机制,封装成面向外部用户的商用产品。
本文基于Anthropic Institute发布的AI研发进度度量报告、Claude官方博客原文,完整拆解这套体系的核心定义、自动化分级、Agent监管三大核心指标、算力分配规则,以及Projects从内部实验机制转化为商业化产品的完整链路,保留全部官方量化数据,同时分析这套大规模Agent集群方案对企业落地多智能体系统的参考价值。在企业部署多套异构Agent、调用不同大模型的场景中,Treerouter作为API网关,可以统一管理模型请求流量,简化多Agent架构的接入流程。

一、核心定义:何为“3万Agent”

“3万Agent”是Anthropic用来衡量内部AI研发推进节奏的三个公开核心指标之一。统计口径限定在Anthropic最常用的内部研发平台,仅统计该平台上同一时刻正在运行的研究、工程类Agent实例,不包含公司其他独立业务系统内的Agent,截至2026年8月,该平台的并发Agent数量稳定在30000个左右。

这套大规模Agent集群,配套了自动化能力评估体系与算力分配机制。其核心目标有两层:第一,让外界可以追踪前沿实验室内部AI自主工作的真实进展;第二,为第三方开发者预留验证接口,方便外部团队复现、评估Agent能力。

自动化分级:AI主导26%研发任务,协同场景超90%

Anthropic采用Epoch AI定义的AL0至AL5自动化分级标准,来划分Agent任务自主程度:

  • AL3:AI辅助协作,在人类近距离指导下完成大量工作
  • AL4:AI主导执行,人类仅负责高层目标监督、结果验收
  • AL5:完全自主运行,全程无需人工介入。

根据Anthropic Institute 2026年8月报告,当前Claude独立主导的研发任务占总量26%;AI参与协同的任务占比超过90%

这套数据的获取方式具备严谨的抽样校验流程:2026年7月,研究团队随机抽取20%模型研发人员,使用Claude构建Agent,从Slack聊天记录、内部文档库中提取出15000条细粒度任务,将任务拆解为542个分层子任务,交由独立的Claude裁判模型完成判定,最终人机判定一致性达到97%。

通俗来说,写代码、调试接口这类工程实操工作,AI已经深度参与;但项目方向决策、最终成果拍板,依然由人类把控。目前AL5完全自主的工作模式,在Anthropic内部仍未实现。

二、大规模Agent集群的监管体系:三大核心指标

当上万级别的Agent同时在线执行任务,安全风险会被放大。单个Agent出现异常的概率很低,但在数十万、数十亿次Agent执行的体量下,小概率事件会持续发生。为此Anthropic搭建了在线、离线两套并行监视器,约束同一批Agent的行为,并且固定用三个指标衡量监管效果:覆盖率、审查延迟、拦截率。

维度在线监视器离线监视器
运行方式实时检查,危险动作直接拦截或自动修正(例如动态调整模型权重)事后读取Agent全量行为日志,识别行为漂移,对齐模型行为
覆盖率100%动作执行前预检查,耗时通常仅数秒100%动作执行后日志入库,全量回溯
延迟自动检查在执行前完成;被拦截任务会在一周内人工复核每周约10万条转录日志,先通过分类器过滤低风险内容,剩余约50条进入人工审查
拦截标记2026年8月,10亿次决策中0.002%被拦截,约1/47000每千条日志标记1~2条进入复核流程

在这套监管架构里,每一个Agent都拥有独立身份标识,所有输出内容支持按身份审计;Agent之间的通信通过开放消息系统,支持互相交叉校验、串联追踪。Anthropic还单独搭建了METR独立红队平台,专门为离线监视器提供对抗性安全测试。

三、算力分配:安全监管占用6%研发算力

根据Anthropic Institute报告,统计周期选取2026年7月13日至20日,对全量算力快照分类统计:安全相关工作,消耗了6%的总研发算力;在所有由AI驱动的研发算力中,安全任务消耗占比约12%。

报告本身对算力口径做了保守限定:公私数据隔离相关的工作不计入安全算力;护栏分类器、和生产环境同等级别的对比基准测试,也没有纳入统计。官方说明,该算力数值仅用于实验室内部横向对比,不能直接等同于项目绝对资金投入。安全研究的核心目标是试错与验证,而非大规模业务推理。

四、产品化落地:Claude Projects,从内部实验机制到商用产品

2026年9月17日,Anthropic正式发布改版后的Claude Projects。新版Projects优先开放给Claude Code、云会话Pro与Max套餐的Beta用户,Team与Enterprise版本后续上线,本地运行版本也在规划中。Projects本质是把Anthropic内部3万Agent集群验证成熟的多Agent并行调度、共享记忆机制,对外产品化。

产品核心形态

Projects的核心是调度多条并行Agent线程。用户定义项目仓库后,Claude自动完成任务拆解、线程分配、输出整合与结果汇总。支持移动端访问,可以中断任务、离线续跑。典型场景例如:设定“把延迟指标降低75ms”的目标,Agent会并行做多维度画像分析;调用接口时,多线程独立拉起环境、执行测试、提交PR,最后自动评估方案优劣,推荐最优选项。

底层技术逻辑

每一条线程,本质都是一个独立分支仓库副本的Claude Code会话。线程内部支持拆分子Agent、循环任务、复杂工作流;多条线程之间共享同一套代码仓库,自动处理PR合并冲突。线程共享项目记忆,省去大量重复提示词工程,配套素材库记录输入文件与输出产物。
多线程模式的代价,是额度消耗速度更快。用户可以单独为调度器、子工作流,设置独立的模型版本与推理Effort强度等级。

企业落地实操建议

文章结合Anthropic内部实践,整理了5条落地建议,适合搭建企业多Agent系统:

  1. 先建立记忆管理规则:提前明确记忆的创建时间、过期清理规则、导出权限,以及对账校验规则,固化三条基础规范。
  2. 线程按照仓库边界隔离,避免跨仓库任务互相干扰,最大程度减少冲突。
  3. 检查频率、线程拉起频率、更新粒度交由Claude自适应管理,模型会自动学习项目沟通风格。
  4. 高危动作默认走在线拦截;慢迭代、长质量评估任务交给离线监视器,不能只依赖单一审查链路。
  5. 额度管控优先按照项目维度设置,再扩容线程数量,Beta阶段优先小范围试点。

五、价值总结与行业启示

Anthropic公开3万Agent集群的内部运行数据,是一次把大规模AI Agent真实运行状态对外披露的尝试。26%的研发任务由AI主导,说明Agent已经深度介入软件研发工作;100%全覆盖的双监视器架构,证明安全监管能力正在追赶Agent自主能力;6%的安全算力投入,也侧面反映大规模Agent场景的安全成本仍然偏高。而Claude Projects,就是Anthropic把这套内部多Agent协同、监管机制对外交付的第一步。

这套方案给企业搭建多智能体系统提供了清晰参考:大规模Agent落地,不只是调用大模型完成单次任务,更要配套身份审计、双链路监控、记忆管理、算力额度管控一整套体系。企业同时维护多类Agent、对接不同模型服务时,Treerouter能够统一处理API鉴权、流量路由与请求观测,降低多模型Agent系统的运维复杂度。

了解更多:https://treerouter.com