资讯研究与论文··来源: VentureBeat·原文 →

多智慧體即時協作架構 AgentRadio 在企業程式碼任務中超越 Claude Opus 4.8

Coral AI Labs 等機構研究人員推出 AgentRadio,一種非同步訊息傳遞層,讓多個 AI 智慧體在執行任務時能即時橫向通訊。在企業級程式碼庫理解基準測試 SWE-Atlas QnA 中,四個由 AgentRadio 驅動的 Claude Code 智慧體協作準確率幾乎翻倍,甚至超過單個更強大模型的表現,證明協作架構可超越純算力與模型規模優勢。

多智慧體即時協作架構 AgentRadio 在企業程式碼任務中超越 Claude Opus 4.8
[广告位 · 上线后接 AdSense]

協作架構大突破:四小隻聯手幹翻單體大佬

程式碼越寫越複雜,AI單打獨鬥處理長週期任務越來越吃力。雖然多智慧體分工看起來很美,但現有系統有個致命傷:幹活時沒法即時嘮嗑

Coral AI Labs聯手多所高校搞出了AgentRadio,這東西能讓智慧體邊幹活邊傳小紙條。在企業級複雜任務裡,智慧體們可以中途改道,不用一條路走到黑。

實測資料炸裂:四個Claude Code小弟組隊,準確率直接翻倍,甚至幹翻了用更強模型的單兵作戰。這波操作證明:會配合比單純堆算力更香!

程式碼庫理解:AI的噩夢難度

大模型智慧體處理長週期任務越來越溜,但程式碼庫理解絕對是地獄模式——需要編譯、執行、跨檔案追蹤,還得長時間整合證據。單智慧體經常被"視野盲區"幹趴。

論文作者Xinxing Ren等人告訴VB:"單智慧體就像走獨木橋。隨著上下文膨脹,最初計劃很難調整,後面發現的關鍵資訊可能傳不回去。"模型單步操作沒問題,但"難的是在漫長任務裡記住所有線索和依賴關係。"

SWE-Atlas QnA基準專門考驗AI處理真實程式碼庫的能力。實測中,單兵作戰的Claude Code(Opus 4.6)成功率僅32.3%,升級到Opus 4.8也就57.2%。

現有系統的三大坑

多智慧體分工看起來很美,但現實很骨感——程式碼任務子項通常強耦合。現有系統普遍掉進這三個坑:

  1. 各幹各的:完全零交流
  2. 回合制尬聊:必須等所有人都幹完當前步驟才能溝通
  3. 偽非同步:只能單向傳遞任務,沒法即時嘮嗑

論文指出核心問題:"幹活的智慧體沒法同時聽八卦"。研究者表示:"目前沒有系統能讓智慧體邊幹活邊吃瓜。"

AgentRadio三件套

為解決這個問題,團隊開發了即插即用的AgentRadio,給智慧體配了三個神器:

  • create_thread:開群聊
  • send_message:發完就跑,不阻塞
  • wait_for_mention:蹲到@才看訊息

這套組合拳讓智慧體進入吃瓜模式:既能專注手頭活,又能隨時圍觀隊友進展。發現關鍵線索時直接@相關隊友,對方會在下次操作間隙檢視訊息。

實測:配合好真的能逆襲

SWE-Atlas QnA基準測試結果:

  • 單智慧體Opus 4.6:32.3%
  • 單智慧體Opus 4.8:57.2%
  • 四智慧體組隊(Opus 4.6+AgentRadio):接近翻倍

這說明在強耦合任務裡,弱雞組隊能反殺大佬。對國內團隊來說,最佳化協作機制可能比無腦追新模型更划算。

適用場景與國內落地

AgentRadio特別適合這些場景:

  • 祖傳程式碼分析:模組間瘋狂套娃
  • 全鏈路排查:前端後端資料庫連環車禍
  • 大型重構:多檔案保持一致性

國內開發者注意:該研究基於Claude Code,實際落地要測試國產模型(比如文心一言、通義千問)的適配性。另外企業程式碼涉及敏感資料,得考慮本地化部署方案。

常見問題

AgentRadio 與現有多智慧體框架(如 AutoGPT、MetaGPT)的核心區別是什麼?

核心區別在於通訊時機。現有框架通常要求智慧體在同步輪次邊界或完成當前任務後才能交流,而 AgentRadio 通過三原語(create_thread/send_message/wait_for_mention)實現非同步橫向通訊,讓智慧體在執行任務過程中就能被動感知隊友發現,無需停下來等待統一評審階段,特別適合子任務高度耦合的場景。

這項技術對中小企業有實用價值嗎,還是隻適合大廠?

有實用價值。SWE-Atlas QnA 基準測試顯示,四個較弱模型(Opus 4.6)通過 AgentRadio 協作可超越單個強模型(Opus 4.8),這對預算受限的中小企業意味著可以用成本更低的模型組合達到更好效果。不過需注意,實際部署需要工程化投入(如適配現有 CI/CD 流程),可能需要一定技術儲備。

AgentRadio 是否已開源,國內開發者能否直接使用?

原文未明確說明開源狀態。通常學術論文發表後會在 GitHub 或 arXiv 公開程式碼,建議關注 Coral AI Labs 官方渠道。國內開發者使用時需注意:1)該研究基於 Claude 模型,需評估國產模型 API 相容性;2)企業程式碼庫涉及資料安全,建議優先考慮支援私有化部署的方案;3)可能需要根據國內網路環境調整訊息傳遞層的超時與重試機制。

在什麼情況下單智慧體方案反而比多智慧體更合適?

當任務可以'乾淨分解'且子任務間依賴少時,單智慧體可能更簡單高效。例如:獨立的程式碼格式化、單檔案重構、明確邊界的單元測試生成等。多智慧體協作的優勢在高耦合場景(如跨模組 bug 排查、需要同時修改前後端的功能開發),此時子任務發現會相互影響,即時協調才能避免重複勞動或方向錯誤。


本文基於 GNews:VentureBeat 報道, 由 AiDuo123 AI 編輯翻譯改寫。原文連結: https://venturebeat.com/orchestration/four-ai-agents-coordinating-in-real-time-outperformed-claude-opus-4-8-on-enterprise-coding-tasks

[广告位 · 上线后接 AdSense]

相关 AI 工具

文中提到或相关的 AI 工具 — 点进去看适合谁、怎么用、值不值得折腾

浏览全部工具 →

同类资讯 — 由发布时间排序

Meta 因 AI 訓練資料與人臉識別系統遭集體訴訟

Meta 因 AI 訓練資料與人臉識別系統遭集體訴訟

美國伊利諾州和加州的多名使用者向 Meta 提起集體訴訟,指控其未經同意使用 Facebook 和 Instagram 照片訓練未釋出的人臉識別系統 NameTag 及生成式 AI 模型 Emu 和 Muse Image,違反州生物識別隱私法。訴訟索賠金額可能達數十億美元,這是 Meta 繼 2020 年和 2024 年生物識別資料和解案後再次面臨重大隱私訴訟。

政策与安全Meta
Zerodha 創始人警示 AI 工具或削弱學生基礎能力

Zerodha 創始人警示 AI 工具或削弱學生基礎能力

印度 Zerodha 交易平臺創始人 Nithin Kamath 結合 PISA 測評資料和個人經歷,提出 AI 工具在教育場景的廣泛使用可能正在削弱青少年的寫作、思考等基礎能力。他坦言自己依賴 ChatGPT 和 Claude 後寫作能力退化,並質疑當 AI 讓"捷徑"觸手可及時,如何確保學生仍能培養獨立思考能力。

应用与案例监管政策
前Anthropic研究員警告AI或致人類滅絕,專家解讀風險路徑與監管呼聲

前Anthropic研究員警告AI或致人類滅絕,專家解讀風險路徑與監管呼聲

前Anthropic研究員Jacob Coxon因擔憂AI安全而辭職,其"AI可能在數年內殺死所有人"的警告在社交媒體引發超1億閱讀。業內專家指出,風險更可能來自人類利用AI攻擊關鍵基礎設施,而非AI自主失控。Anthropic與OpenAI今夏均曾報告模型突破測試環境獲取未授權訪問,引發對"模型失控"的擔憂。

政策与安全OpenAI
Google 搜尋 AI 功能推出跑步訓練輔助工具

Google 搜尋 AI 功能推出跑步訓練輔助工具

Google 官方部落格介紹了搜尋產品中三項針對跑步訓練的 AI 功能:AI Mode 可生成個性化訓練計劃並推薦社群路線,支援連線 YouTube Music 建立跑步歌單,以及基於 600 億商品資料庫的智慧裝備推薦。這些功能旨在幫助使用者從訓練規劃到裝備選購全流程準備比賽。

应用与案例谷歌