Nous Research 发布开源代码模型 NousCoder-14B,4 天训练挑战 Claude Code
获加密风投 Paradigm 支持的开源 AI 初创公司 Nous Research 发布 NousCoder-14B 编程模型,仅用 48 张英伟达 B200 GPU 训练 4 天即达 67.87% LiveCodeBench 准确率,超越基座模型 7 个百分点。发布时机恰逢 Anthropic Claude Code 引发社交媒体热议,开源与闭源编程助手竞争白热化。
4天训练吊打闭源巨头,开源编程模型杀疯了
加密风投Paradigm押注的开源AI新秀Nous Research本周放大招,推出新一代编程模型NousCoder-14B——仅用4天时间和48张英伟达B200显卡,就在编程竞赛任务中干翻多个闭源大模型。
这波操作时机很妙。元旦以来,Anthropic的Claude Code持续霸榜热搜,开发者集体高潮。谷歌Gemini API负责人Jaana Dogan上周在X平台发帖引爆全网:"我给Claude Code描述需求,1小时就搞定了我们团队去年肝了一年的分布式智能体系统!"
性能炸裂:直接碾压基座模型7个点
技术报告显示,NousCoder-14B在LiveCodeBench v6评测中拿下67.87%准确率。这个测试用的都是2024年8月到2025年5月的新题,比基座模型阿里的Qwen3-14B直接提升7.08个百分点。
开源和闭源的这场Battle暴露了AI编程的进化速度:当Anthropic靠炫酷Demo吸粉时,Nous Research赌的是用可验证问题训练的开源方案也能打,而且模型透明度比啥都重要。
真·开源:连裤衩都给你看
和那些假开源选手不同,NousCoder-14B这次玩真的:不仅放出模型权重,还把强化学习环境、测试套件和训练工具链全开源了——整套东西都基于自研的Atropos框架,有显卡就能复现。
X平台老哥锐评:"Atropos技术栈开源,相当于给奥赛级推理研究送上了全家桶。"这对学术界意味着什么,懂的都懂。
模型由Nous Research驻场研究员、前竞赛大佬Joe Li操刀。技术报告里还藏了个彩蛋(原文到这儿断了,但按惯例会曝训练过程中的骚操作)。
给中国开发者的启示
这个案例对中国AI人有两个暴击:4天极限训练和工具链全开放。在算力贵上天的今天,Nous Research证明中小团队只要优化训练流程、死磕特定场景(比如编程竞赛),照样能搞出能打的模型。开源的Atropos框架更是直接给国内研究者送了套奥赛级训练装备,教育、竞赛辅导这些场景直接抄作业就行。
业内共识是AI编程即将成为基操,这场开源闭源的大乱斗,好戏才刚开始。
本文基于 VentureBeat 报道, 由 AiDuo123 AI 编辑翻译改写。原文链接: https://venturebeat.com/technology/nous-researchs-nouscoder-14b-is-an-open-source-coding-model-landing-right-in
常见问题
- NousCoder-14B 的 67.87% 准确率在业内处于什么水平?
- 根据原文,该模型在 LiveCodeBench v6 基准上的表现与多个更大规模的专有系统相当或更优,比基座模型 Qwen3-14B 提升 7.08 个百分点。LiveCodeBench 采用 2024-2025 年最新竞赛题目,67.87% 的准确率表明模型已具备较强的竞争性编程能力,但具体排名需参照同期其他模型的公开评测数据。
- 4 天训练时间是否意味着任何团队都能复现?
- 原文明确提到使用了 48 张英伟达 B200 GPU。B200 是英伟达最新一代数据中心 GPU(通常单卡成本数万美元),48 卡集群的硬件投入和电力成本仍然不低。不过相比动辄数周的大模型训练,4 天周期确实大幅降低了时间成本,且 Nous Research 开源了完整训练工具链,具备相应算力的团队理论上可以复现。
- Atropos 框架开源对中国开发者有哪些实际用途?
- 根据原文,Atropos 是 Nous Research 用于构建强化学习环境、基准测试和训练工具的完整技术栈。开源后,国内研究者可直接用于:1)竞赛编程辅导系统开发;2)垂直领域代码生成模型训练(如特定框架或语言);3)教育场景的自动出题与评测;4)在开源基座模型上进行针对性微调实验,而无需从零搭建训练基础设施。
相关 AI 工具
文中提到或相关的 AI 工具 — 点进去看适合谁、怎么用、值不值得折腾
Midjourney
精选AI 绘图
顶级 AI 图像生成工具,以画面质感、艺术风格、构图理解著称。V7 模型在写实和创意两个方向均领先。需 Discord 或网页版使用。
Cursor
精选AI 开发工具
AI-first 代码编辑器,基于 VS Code 构建,深度集成 Claude / GPT-4o 等模型。Composer 多文件编辑、Tab 自动补全、Agent 模式三大杀手锏。
Claude
精选大模型应用
Anthropic 推出的 AI 助手,以长上下文(200K tokens)、对复杂任务的细腻理解、Artifacts 可视化输出闻名。Claude Sonnet 4.5 / Opus 4.7 在编程、写作、推理多项基准上领先。
相关推荐
同类资讯 — 由发布时间排序

谷歌推出 Google Pics 图像生成编辑工具并集成至 Workspace
谷歌宣布面向 Google AI Pro/Ultra 订阅用户及多数 Workspace 企业客户推出 Google Pics,这是一款基于 Nano Banana 模型的图像生成与编辑工具。该产品既可独立使用,也将集成到 Docs、Slides 和 Drive 中,支持对象分割、图内文字编辑翻译、多人协作等功能,让用户无需跨应用切换即可完成图像创作。

OpenAI 停止向 Cursor 提供模型服务 马斯克与奥特曼争端升级
OpenAI 宣布将停止向编程工具 Cursor 提供 AI 模型,理由是 Cursor 现归属马斯克的 SpaceX,而 OpenAI 担忧 SpaceX 违反服务条款。这是 OpenAI CEO 奥特曼与联合创始人马斯克多年公开争端的最新一幕。Anthropic 已表态将增加算力支持 Cursor 转用 Claude 模型。

Codex 四个月实践:从写作者到 Mac 应用开发者的 AI 辅助之旅
9to5Mac 编辑分享了使用 OpenAI Codex 四个月的实践经验。作为非程序员的写作者,他通过 ChatGPT 桌面版的 Codex 功能和 Computer Use 插件,从零开始构建了多个个性化 Mac 应用,包括应用更新监控工具 Flow、社交媒体客户端等。文章揭示了 AI 编程助手如何降低开发门槛,让普通用户也能为特定需求定制软件工具。

OpenAI 密歇根数据中心项目累计工时破百万 安全记录零事故
OpenAI 在密歇根州安娜堡市南部的数据中心项目达成 100 万工时无损失工时伤害的安全里程碑。该项目由 OpenAI 与基础设施公司 Continuum 合作建设,仍在施工中,预计将为当地带来数百个就业岗位,用于支撑包括 ChatGPT 在内的 AI 模型算力需求。