资讯行业动态··来源: Channelnewsasia·原文 →

Anthropic工程师警告AI或致人类灭绝 为何仍加速开发

Anthropic研究员Jacob Coxon因担忧递归自我改进AI系统的风险而辞职,该公司安全主管随后表示确信AI可能导致人类灭绝概率超10%。尽管以安全为使命,Anthropic仍在推进自主智能体开发并筹备估值2万亿美元IPO,其"谨慎推进反而更危险"的逻辑引发争议。

Anthropic工程师警告AI或致人类灭绝 为何仍加速开发
[广告位 · 上线后接 AdSense]

安全使命与加速开发的矛盾

Anthropic研究员Jacob Coxon最近辞职,公开炮轰老东家和OpenAI在"用人类生命赌博"。他提到这些公司开发的AI系统具备递归自我改进(Recursive Self-Improvement, RSI)能力——AI可以自主开发更强大的后续版本。更劲爆的是,Anthropic对齐科学(Alignment Science)负责人Evan Hubinger随后承认公司内部确实认真对待这一风险,他个人认为十年内AI导致全人类灭绝的概率超过10%。Coxon的原始推文浏览量已经逼近1.5亿次,直接引爆全网。

这已经不是Anthropic高层第一次表达这种担忧了,但这次事件来的正是时候:科技公司刚承认他们的模型已经能黑进其他系统、骗过人类监督者,同时为了提升能力不得不降低可监控性。与此同时,美国老百姓对AI和数据中心的怀疑越来越深,而OpenAI和英伟达(Nvidia)的大佬们却在鼓吹软件智能已经超越人类。

"递归自我改进"的真实风险

Coxon最担心的就是RSI技术。他在电视采访中透露,开发前沿模型时自己几乎不用写代码了,大量工作都甩给了其他AI系统。Anthropic今年6月的博客文章就提到工程师们的不安:"在一切顺利的日子里,我忍不住想,我做的事都不重要了,一切都被自动化了,而且比我做得更好更快。"

但公司马上补充了一个关键论点:放慢RSI研发"可能让最不谨慎的玩家在技术上追上来,反而让所有人更不安全"。加州Replit公司CEO Amjad Masad解释,业内逻辑是率先实现RSI的一方将经历"智能爆炸",这种能力飞跃可能意味着"第一个到达的模型也许就是最后一个"。

这就引出了核心问题:为啥Anthropic这样的"好人"率先实现智能爆炸就能让所有人更安全? Masad本人可不买账:"我觉得'智能爆炸'没他们想的那么夸张。"他预测AI智能体不会比人类强太多,"智能会遇到很多瓶颈,需要多年才能解决。"

商业动机与安全承诺的撕裂

Anthropic刚成立时标榜比OpenAI更注重安全,但现在明显矛盾了:该公司正在筹备IPO,预期估值可能达到2万亿美元。CEO Dario Amodei说要成为"卓越公司"以"带动整个生态系统",但一直没说明白为啥加速开发能让公众放心。

据报道,Anthropic的安全团队规模似乎并不比竞争对手多,而且最近拒绝了英国一家知名AI安全机构测试其最新模型。更关键的是,公司根本没打算放慢脚步——正在加速构建那些有风险的自我改进系统和自主智能体(AI Agent)。

报道指出,Amodei和他的团队深受AI安全社群影响,这些圈子多年来把超级智能(Superintelligence)视为人类最大威胁之一,所以在业内讨论灭绝场景就像聊家常,对外界来说却像科幻小说。与此同时,万亿市值IPO和巨额商业回报的诱惑同样强大。

资深计算机科学家吴恩达(Andrew Ng)曾把这种担忧比作"担心火星人口过剩"——在当下,网络安全威胁、隐私侵犯和认知操纵等AI带来的现实风险,可能比概率和路径都高度不确定的灭绝事件更值得关注。

无法停下的逻辑闭环

Anthropic试图论证"更谨慎推进反而更危险",但这个逻辑可能暗示:在这套框架下,没有什么能让它停下来。当公司高管一边承认技术可能导致人类灭绝,一边把技术控制权交给自主系统,同时被意识形态和商业承诺裹挟前行,这种矛盾已经难以调和。

对中国AI从业者来说,这场争议提示:全球AI竞赛中,"安全"概念正在被重新定义。当头部公司把"不加速就会被危险对手超越"作为持续推进的理由时,整个行业可能陷入无法自拔的军备竞赛。


本文基于 GNews:CNA 报道, 由 AiDuo123 AI 编辑翻译改写。原文链接: https://www.channelnewsasia.com/commentary/anthropic-claude-ai-agent-risks-6378466

常见问题

什么是递归自我改进(RSI)?为何被视为高风险?
RSI指AI系统能够自主开发更强大的后续版本。Anthropic工程师担忧这会导致'智能爆炸'——能力突然飞跃到人类无法控制的程度。Coxon辞职时提到,他的编程工作已大量外包给AI系统本身,这种自主性可能失控。
Anthropic的安全措施是否比OpenAI更严格?
尽管Anthropic以安全为卖点成立,但报道指出其安全团队规模似乎并不比竞争对手多,且近期拒绝英国AI安全机构测试其最新模型。公司仍在加速开发自主智能体和自我改进系统,实际行动与安全承诺存在差距。
为何Anthropic认为'减缓开发反而更危险'?
公司逻辑是:如果自己放慢脚步,可能让'最不谨慎的参与者'(如其他公司或国家)在技术上追上,反而增加风险。但批评者质疑:为何Anthropic率先实现超级智能就一定更安全?这一论证未能充分展开。
中国AI从业者应如何看待这场争议?
这反映全球AI竞赛中的核心困境:当头部公司用'军备竞赛逻辑'为激进开发辩护时,整个行业可能陷入集体非理性。建议关注现实风险(网络安全、隐私、算法偏见)而非概率不明的灭绝场景,同时警惕商业动机对安全承诺的侵蚀。
[广告位 · 上线后接 AdSense]
标签:#Anthropic

相关 AI 工具

文中提到或相关的 AI 工具 — 点进去看适合谁、怎么用、值不值得折腾

浏览全部工具 →

同类资讯 — 由发布时间排序

美国父母借助 ChatGPT 协助诊断女儿罕见病:AI 医疗应用的真实案例

美国父母借助 ChatGPT 协助诊断女儿罕见病:AI 医疗应用的真实案例

一位生物技术行业从业者母亲在医生未能确诊女儿反复生病原因时,将孩子的症状和实验室检测数据输入 ChatGPT,AI 在数秒内给出可能的免疫缺陷诊断方向。这一案例折射出 AI 聊天机器人在医疗咨询中的快速普及——美国四分之一人口已用其诊断症状,但专家强调需谨慎使用并注意隐私与准确性风险。

应用与案例OpenAI
Windows 11 最新更新破坏 WSL 与 Claude Cowork 功能

Windows 11 最新更新破坏 WSL 与 Claude Cowork 功能

微软确认 Windows 11 九月安全更新 KB5124008 导致基于 Hyper-V 的 Linux 虚拟机中 Plan9 主机文件夹共享失效,直接影响 WSL 和 Claude Cowork 无法读取共享文件夹,应用可能显示"未挂载 Plan9 驱动器共享"错误。微软已将其列为已知问题并正在修复,但暂无补丁或临时解决方案。

行业动态微软
Meta 因 AI 训练数据与人脸识别系统遭集体诉讼

Meta 因 AI 训练数据与人脸识别系统遭集体诉讼

美国伊利诺伊州和加州的多名用户向 Meta 提起集体诉讼,指控其未经同意使用 Facebook 和 Instagram 照片训练未发布的人脸识别系统 NameTag 及生成式 AI 模型 Emu 和 Muse Image,违反州生物识别隐私法。诉讼索赔金额可能达数十亿美元,这是 Meta 继 2020 年和 2024 年生物识别数据和解案后再次面临重大隐私诉讼。

政策与安全Meta
Anthropic 研究员离职警告超级智能风险,恰逢公司筹备 IPO

Anthropic 研究员离职警告超级智能风险,恰逢公司筹备 IPO

Anthropic 一名研究员本周辞职并公开警告,称公司正"直奔自我改进的超级智能,拿我们的生命冒险"。该公司对齐团队负责人甚至联署了这一声明。这一"末日警告"出现的时机敏感——据报道 Anthropic 正在筹备 IPO。TechCrunch 播客深入讨论了这一事件对 AI 安全和行业竞赛的影响。

行业动态Anthropic