跳到正文
热点事件持续更新

研究称多Agent团队耗Token激增但质量提升微弱

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月11日,The Decoder报道:Vals AI在Vibe Code Bench基准上对GPT-6 Sol和Claude Opus 5.5的单Agent与多Agent配置进行了对比测试。结果显示,多Agent团队配置相比单Agent消耗的Token数量为1.8倍到5.1倍不等,但在四项对比中,只有GPT-6 Sol在中等推理设置下,团队配置的得分显著高出单Agent 7.3分;在最大推理设置下,多Agent团队并未表现出任何优势。该研究指出,多Agent协作模式在代码任务上带来的质量提升有限,却伴随显著更高的计算开销。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月11日
  1. The Decoder
    研究称多 agent 团队消耗大量 token 但几乎不提升质量

    Vals AI 在 Vibe Code Bench 上测试 GPT-6 Sol 和 Claude Opus 5.5 的单 agent 与多 agent 表现,发现团队配置比单 agent 多花 1.8x 到 5.1x token,但四项对比中只有 GPT-6 Sol 中等推理下的团队得分显著高出 7.3 分,最大推理下没有优势。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。