Nous Research 釋出開原始碼模型 NousCoder-14B,4 天訓練挑戰 Claude Code
獲加密風投 Paradigm 支援的開源 AI 初創公司 Nous Research 釋出 NousCoder-14B 程式設計模型,僅用 48 張輝達 B200 GPU 訓練 4 天即達 67.87% LiveCodeBench 準確率,超越基座模型 7 個百分點。釋出時機恰逢 Anthropic Claude Code 引發社交媒體熱議,開源與閉源程式設計助手競爭白熱化。
4天訓練吊打閉源巨頭,開源程式設計模型殺瘋了
加密風投Paradigm押注的開源AI新秀Nous Research本週放大招,推出新一代程式設計模型NousCoder-14B——僅用4天時間和48張輝達B200顯示卡,就在程式設計競賽任務中幹翻多個閉源大模型。
這波操作時機很妙。元旦以來,Anthropic的Claude Code持續霸榜熱搜,開發者集體高潮。谷歌Gemini API負責人Jaana Dogan上週在X平臺發帖引爆全網:"我給Claude Code描述需求,1小時就搞定了我們團隊去年肝了一年的分散式智慧體系統!"
效能炸裂:直接碾壓基座模型7個點
技術報告顯示,NousCoder-14B在LiveCodeBench v6評測中拿下67.87%準確率。這個測試用的都是2024年8月到2025年5月的新題,比基座模型阿里的Qwen3-14B直接提升7.08個百分點。
開源和閉源的這場Battle暴露了AI程式設計的進化速度:當Anthropic靠炫酷Demo吸粉時,Nous Research賭的是用可驗證問題訓練的開源方案也能打,而且模型透明度比啥都重要。
真·開源:連褲衩都給你看
和那些假開源選手不同,NousCoder-14B這次玩真的:不僅放出模型權重,還把強化學習環境、測試套件和訓練工具鏈全開源了——整套東西都基於自研的Atropos框架,有顯示卡就能復現。
X平臺老哥銳評:"Atropos技術棧開源,相當於給奧賽級推理研究送上了全家桶。"這對學術界意味著什麼,懂的都懂。
模型由Nous Research駐場研究員、前競賽大佬Joe Li操刀。技術報告裡還藏了個彩蛋(原文到這兒斷了,但按慣例會曝訓練過程中的騷操作)。
給中國開發者的啟示
這個案例對中國AI人有兩個暴擊:4天極限訓練和工具鏈全開放。在算力貴上天的今天,Nous Research證明中小團隊只要最佳化訓練流程、死磕特定場景(比如程式設計競賽),照樣能搞出能打的模型。開源的Atropos框架更是直接給國內研究者送了套奧賽級訓練裝備,教育、競賽輔導這些場景直接抄作業就行。
業內共識是AI程式設計即將成為基操,這場開源閉源的大亂鬥,好戲才剛開始。
常見問題
NousCoder-14B 的 67.87% 準確率在業內處於什麼水平?
根據原文,該模型在 LiveCodeBench v6 基準上的表現與多個更大規模的專有系統相當或更優,比基座模型 Qwen3-14B 提升 7.08 個百分點。LiveCodeBench 採用 2024-2025 年最新競賽題目,67.87% 的準確率表明模型已具備較強的競爭性程式設計能力,但具體排名需參照同期其他模型的公開評測資料。
4 天訓練時間是否意味著任何團隊都能復現?
原文明確提到使用了 48 張輝達 B200 GPU。B200 是輝達最新一代資料中心 GPU(通常單卡成本數萬美元),48 卡叢集的硬體投入和電力成本仍然不低。不過相比動輒數週的大模型訓練,4 天週期確實大幅降低了時間成本,且 Nous Research 開源了完整訓練工具鏈,具備相應算力的團隊理論上可以復現。
Atropos 框架開源對中國開發者有哪些實際用途?
根據原文,Atropos 是 Nous Research 用於構建強化學習環境、基準測試和訓練工具的完整技術棧。開源後,國內研究者可直接用於:1)競賽程式設計輔導系統開發;2)垂直領域程式碼生成模型訓練(如特定框架或語言);3)教育場景的自動出題與評測;4)在開源基座模型上進行針對性微調實驗,而無需從零搭建訓練基礎設施。
本文基於 VentureBeat 報道, 由 AiDuo123 AI 編輯翻譯改寫。原文連結: https://venturebeat.com/technology/nous-researchs-nouscoder-14b-is-an-open-source-coding-model-landing-right-in
相关 AI 工具
文中提到或相关的 AI 工具 — 点进去看适合谁、怎么用、值不值得折腾
Midjourney
精选AI 绘图
頂級 AI 影像生成工具,以畫面質感、藝術風格、構圖理解著稱。V7 模型在寫實和創意兩個方向均領先。需 Discord 或網頁版使用。
Cursor
精选AI 开发工具
AI-first 程式碼編輯器,基於 VS Code 構建,深度整合 Claude / GPT-4o 等模型。Composer 多檔案編輯、Tab 自動補全、Agent 模式三大殺手鐧。
Claude
精选大模型应用
Anthropic 推出的 AI 助手,以長上下文(200K tokens)、對複雜任務的細膩理解、Artifacts 視覺化輸出聞名。Claude Sonnet 4.5 / Opus 4.7 在程式設計、寫作、推理多項基準上領先。
相关推荐
同类资讯 — 由发布时间排序

OpenAI 釋出 GPT-6 Astra 模型:聲稱邁入 AGI 時代的關鍵一步
OpenAI 正式推出其最強 AI 模型 GPT-6 Astra,CEO Sam Altman 稱其為"全球最佳計算機使用、專業工作、科學、程式設計及網路安全模型"。公司總裁 Greg Brockman 認為"我們現在處於 AGI 時代並非不合理",該模型在 FrontierMath Tier 4 得分 98%、ARC-AGI 3 達 99.9%,並已向 ChatGPT Plus 及企業使用者分階段開放。

OpenAI、Anthropic 與 xAI 同日宕機:各家回應不一致引發猜測
2024 年 9 月 3 日上午,OpenAI ChatGPT、Anthropic Claude 和 xAI Grok 三大前沿 AI 模型服務同時出現罕見宕機。xAI 將問題歸因於孟菲斯計算中心故障,OpenAI 稱系路由錯誤,而 Anthropic 拒絕評論具體原因。三家公司均未指向共同的第三方服務商,但時間上的巧合仍引發行業對基礎設施依賴性的關注。

Meta 推出 Muse Spark 模型差異化定價:共享資料最高降價 95%
Meta 為其新發布的 Muse Spark 代理模型推出雙軌定價策略,使用者若同意共享提示詞和模型輸出用於訓練,可享受最高 95% 的價格折扣。這一機制將資料貢獻明碼標價,反映出 AI 公司在獲取高質量訓練資料(尤其是代理工具使用資料)方面的迫切需求,同時也可能重塑企業客戶對資料共享的決策邏輯。

ChatGPT、Claude 與 Grok 同時宕機引發 GPT-6 Astra 猜測升溫
2026年9月3日,OpenAI 的 ChatGPT、Anthropic 的 Claude 以及 xAI 的 Grok 三大主流 AI 平臺幾乎同時出現服務中斷,影響網頁、移動端及 API 使用者。宕機發生時恰逢 OpenAI 在社交媒體釋出"星辰即將對齊"的神秘預告,引發業內對下一代模型 GPT-6 Astra 即將釋出的廣泛猜測。