谷歌 Gemini 3.7 Flash 评测:廉价模型的显著进化与短板
谷歌 8 月 13 日发布的 Gemini 3.7 Flash 在代码生成能力上实现质的飞跃,能在 2 分 13 秒内从单一提示词生成可运行的浏览器游戏,而三周前的 3.6 版本完全无法完成此任务。该模型年底前定价仅为每百万输入 token 0.75 美元,是前代的一半。但在逻辑推理和创意写作测试中,这款廉价模型仍输给了可免费运行的开源模型。

代码生成:从翻车到一次过
谷歌8月13日发布的Gemini 3.7 Flash在零样本代码生成测试中表现炸裂。测试要求AI仅凭一句话提示直接生成能跑通的浏览器游戏,不给示例代码,也不让改bug。
实测结果太顶了:这货2分13秒就吐出了开箱即玩的游戏代码,语法规范,碰撞检测和计分系统全搞定,视觉效果远超这个价位的预期。最狠的是对比:7月21日的Gemini 3.6 Flash在同样测试中直接翻车——生成的HTML格式错误,元素渲染全崩,让它自己修都修不好。当时评测团队只能把代码丢给DeepSeek抢救(人家找出了11个bug修好8个)。
这波升级直接让3.7 Flash的实用代码能力逼近GPT-5.6 Sol。不过要注意,它更擅长执行明确需求而不是搞创意,提示词模糊输出就拉胯。
定价策略:年底前薅羊毛窗口
Gemini 3.7 Flash在2024年12月31日前定价每百万输入token只要0.75刀,是3.6 Flash的半价;2025年1月1日起涨到1.50刀。这模型首日就在160+国家上线,支持百万级token输入、6.4万token输出,能处理图片、视频、音频和PDF,还带工具调用和计算机操作能力。
谷歌自家测试数据显示,3.7 Flash在18个测试类别中有11项干翻了Claude Sonnet 5和GPT-5.6 Terra。关键指标包括Code Arena网页开发榜拿到1588 Elo分,AutomationBench上跑出30.4%成绩(注意这些是谷歌自家测试方法得出的)。
创意写作:被免费开源模型吊打
在创意写作测试中,Gemini 3.7 Flash露馅了。测试要求写个时间旅行故事:主角从2150年回到公元1000年,必须形成因果闭环——他的骚操作正好创造了他想阻止的未来,核心规则是:主角回到未来前不能明白自己干了啥。
Gemini故事框架还行:主角往比利牛斯山脉裂缝轰熵能炮,意外造出奴役22世纪伊比利亚的方尖碑。但写到一半就让主角开悟了("这就是灰烬尖塔的基座"),直接破功。
更明显的是AI写作通病:几乎每个名词都硬塞两个形容词("超发光塔楼""潮湿长苔的土地""浓密黑曜石头发"),典型"预测下一个词"而非真创作,导致出现"巨石低频嗡嗡响"这种废话。
评测团队拿Qwopus3.5-27B-v3对比(基于Qwen3.5-27B的社区微调模型,蒸馏了Claude Opus风格推理,消费级显卡就能免费跑)。Qwopus严格遵守了Gemini违反的规则:主角在真实的拉里奥哈圣米兰修道院杀了个僧侣,直到回2150年发现古抄本里的DNA才明白真相。
虽然Qwopus也有瑕疵(输出了完整规划草稿,结尾有点破功),但文学质量和规则遵守完胜Gemini。这说明特定创意任务上,精心调教的开源模型可能比通用商业货更顶。
逻辑推理:和Claude一起翻车
在桥梁逻辑谜题测试中,Gemini 3.7 Flash给出了和Claude Fable 5一样的错误答案。数学题测试里,模型框架搭对了但没算到底。
适用场景:高频低难度任务神器
Flash系列从来不是解决硬核问题的首选。它的价值在于:文本分类、会话压缩(防上下文爆炸)、文档摘要这些不值得用旗舰模型的场景。从这些需求看,3.7 Flash确实是实打实的升级;但和旗舰模型或专用微调比,它仍是个"能用但写作质量会被免费软件吊打"的选择。
国内开发者注意:年底前的羊毛价特别适合批量API调用、内容初筛、代码脚手架生成这些场景。但复杂逻辑推理和创意内容还是得靠旗舰模型或针对性调教的开源方案。
本文基于 GNews:Decrypt 报道, 由 AiDuo123 AI 编辑翻译改写。原文链接: https://decrypt.co/375730/gemini-3-7-flash-review-google-cheap-model
常见问题
- Gemini 3.7 Flash 相比 3.6 版本最大的改进是什么?
- 代码生成能力实现质的飞跃。3.6 Flash 在零样本游戏开发测试中完全失败(生成的代码无法运行),而 3.7 Flash 能在 2 分 13 秒内生成首次运行即可玩的浏览器游戏,无需任何修复。这使其在实用代码生成能力上接近 GPT-5.6 Sol 水平。
- 这个模型的定价策略是怎样的?
- 2024 年 12 月 31 日前为每百万输入 token 0.75 美元(是 3.6 Flash 的一半),2025 年 1 月 1 日起涨至 1.50 美元。支持最多 100 万 token 输入和 6.4 万 token 输出,可处理多模态内容(图像、视频、音频、PDF)。
- Gemini 3.7 Flash 适合用在哪些场景?
- 最适合高频低难度任务:文本分类、文档摘要、代理会话上下文压缩、代码脚手架生成等不值得用旗舰模型付费的场景。但在复杂逻辑推理、创意写作、需要严格遵守抽象规则的任务上表现不如旗舰模型,甚至可能输给专门微调的开源模型。
- 为什么评测显示它在创意写作上输给了免费开源模型?
- 在时间旅行故事测试中,Gemini 违反了核心规则(让主角提前理解因果循环),且文本充满 AI 典型痕迹(过度使用形容词堆砌)。而 Qwopus3.5-27B-v3(基于 Qwen 微调的开源模型)虽也有瑕疵,但遵守了规则且文学质量更高。这说明在特定创意任务上,针对性微调的开源模型可能比通用商业模型更合适。
- 中国开发者使用这个模型需要注意什么?
- 一是把握年底前的低价窗口期(0.75 美元/百万 token);二是明确其定位——适合批量 API 调用等成本敏感场景,但不要期待它在复杂推理或高质量内容创作上媲美旗舰模型;三是代码生成时需提供明确规格,模糊提示词会导致模糊输出;四是需确认服务在目标地区的可用性(谷歌称首日在 160 多个国家上线,但具体访问条件需核实)。
相关 AI 工具
文中提到或相关的 AI 工具 — 点进去看适合谁、怎么用、值不值得折腾
Midjourney
精选AI 绘图
顶级 AI 图像生成工具,以画面质感、艺术风格、构图理解著称。V7 模型在写实和创意两个方向均领先。需 Discord 或网页版使用。
Cursor
精选AI 开发工具
AI-first 代码编辑器,基于 VS Code 构建,深度集成 Claude / GPT-4o 等模型。Composer 多文件编辑、Tab 自动补全、Agent 模式三大杀手锏。
Claude
精选大模型应用
Anthropic 推出的 AI 助手,以长上下文(200K tokens)、对复杂任务的细腻理解、Artifacts 可视化输出闻名。Claude Sonnet 4.5 / Opus 4.7 在编程、写作、推理多项基准上领先。
相关推荐
同类资讯 — 由发布时间排序

苹果手表新 AI 功能引争议:环境录音与隐私的边界在哪里
苹果在最新发布会上为 Apple Watch 引入了 Live Rewind 和 Siri Recap 等实时音频转录功能,允许用户回溯 15 秒对话并自动生成会议摘要。尽管苹果强调不存储原始音频且支持端到端加密,但这些"始终聆听"的技术仍引发了关于同意权、法律证据效力及社交行为改变的广泛讨论,标志着科技巨头在 AI 竞争压力下对隐私底线的重新定义。

ControlAI 执行董事:超级智能不是武器而是对手,应立法禁止开发
AI 安全非营利组织 ControlAI 美国执行董事 Connor Leahy 在 TechCrunch 播客中提出激进观点:应通过立法完全禁止企业开发超级智能(superintelligence),而非仅依赖对齐与遏制技术。他认为当 AI 能自主改进 AI 时将触发失控循环,并透露美英两国已有相关立法推进,包括 Sanders-Casar 提出的"禁止超级智能法案"。

五角大楼要求 OpenAI 提供"低拒绝率"军用 AI 引发争议
据 The Intercept 报道,美国国防部曾要求 OpenAI 提供一个"极少拒绝执行"军事指令的定制版 AI 系统。OpenAI 否认签署过包含此类措辞的合同。这一事件再次引发关于 AI 安全护栏与军事应用边界的讨论,对中国 AI 从业者理解大模型伦理约束具有参考意义。

Meta 推出 Muse AI 智能体,隐私信任成最大挑战
Meta 在达成 180 亿美元和解协议后不到两周,推出个人 AI 智能体 Muse,可连接邮件、日历、支付等服务代用户执行任务。产品采用独立虚拟机架构保护隐私,但 Meta 多次违反隐私承诺的历史记录,令消费者信任成为产品成败关键。