K Health 自主醫療 AI 在模擬病例中診斷準確率達 90.2%,超越人類醫生
數字初級醫療服務商 K Health 開發的自主 AI 系統在基於電子健康記錄(EHR)的 200 個模擬病例測試中,診斷準確率達 90.2%,顯著高於 50 名執業醫生的 77.9%;治療方案對臨床指南的遵循度更達 98.7%。該研究已發表於《自然·醫學》,研究者強調 AI 旨在增強而非替代醫生能力。

AI看病比老醫生還準?最新研究結果讓人意外
醫療AI又有新突破!數字醫療公司K Health研發的AI系統,在一項電子病歷(EHR)診斷測試中,表現碾壓人類醫生。這項重磅研究剛登上頂級期刊《自然·醫學》。
實測資料:AI全面領先
研究設定200個模擬病例,覆蓋心腦血管、糖尿病等常見病。參賽選手:
- AI選手:K Health的智慧診斷系統
- 人類選手:50位持證上崗的全科醫生
比賽專案:診斷準確率、治療方案靠譜程度、該做的檢查有沒有漏。
成績單來了:
- 診斷準確率:AI 90.2% vs 醫生77.9%
- 治療方案規範度:AI 98.7% vs 醫生82.7%
- 犯錯次數:AI明顯更少(具體數字沒公佈)
K Health首席創新官Ran Balicer博士說:"這標誌著AI不僅能當助手,在某些場景下已經可以獨當一面了。"
不是來搶飯碗的
研究團隊特別強調:
- AI是來幫忙的——把簡單病例交給AI,醫生專心搞疑難雜症
- 重點是解決看病難——特別是缺醫少藥的偏遠地區
AI最牛的是能發現醫生容易忽略的細節,減少誤診和亂開藥的情況。
落地還要多久?
雖然成績亮眼,但研究者坦言:
- 還需要更多臨床試驗
- 得先搞定倫理和監管問題
【國內使用者劃重點】 目前國內批准的醫療AI都是"輔助診斷"(比如看CT片),像這種能獨立看病的AI還沒上崗。短期內最可能先在社群醫院試點,幫居民做初步篩查。
要注意的是,這次測試用的都是模擬病例,真實看病時那些需要"望聞問切"的複雜情況,AI能不能hold住還是未知數。
常見問題
K Health 的 AI 系統是否已在真實醫療場景中使用?
原文未明確說明。研究基於模擬病例測試,研究者強調需進一步驗證才能廣泛臨床應用。K Health 作為數字初級醫療服務商,可能已在其平臺內部使用類似技術,但具體部署情況需查閱公司官方資訊。
90.2% 的診斷準確率在醫療 AI 中處於什麼水平?
這一資料在基於 EHR 的初級醫療診斷任務中屬於較高水平。但需注意:準確率受病例複雜度、疾病型別影響,且研究由 AI 開發方主導。獨立第三方驗證和真實世界表現資料將更具參考價值。
中國使用者能否使用類似的自主診療 AI?
目前不能。中國對醫療 AI 實行嚴格審批,自主診療功能需符合三類醫療器械標準。現有獲批產品多為輔助診斷工具。未來此類技術可能先在網際網路醫院、基層醫療機構的標準化場景(如常見病初篩)試點,但完全替代醫生決策在短期內不現實。
AI 診斷準確率更高,是否意味著醫生會被取代?
研究者明確表示目標是增強而非替代。AI 在標準化流程和指南遵循上有優勢,但醫療涉及複雜溝通、倫理判斷、罕見病識別等 AI 難以處理的場景。更可能的趨勢是 AI 處理常規病例,醫生聚焦複雜與危重症患者。
本文基於 GNews:News-Medical.net 報道, 由 AiDuo123 AI 編輯翻譯改寫。原文連結: https://www.news-medical.net/news/20260621/Autonomous-medical-AI-outperforms-doctors-in-simulated-EHR-cases.aspx
相关 AI 工具
文中提到或相关的 AI 工具 — 点进去看适合谁、怎么用、值不值得折腾
Midjourney
精选AI 绘图
頂級 AI 影像生成工具,以畫面質感、藝術風格、構圖理解著稱。V7 模型在寫實和創意兩個方向均領先。需 Discord 或網頁版使用。
Cursor
精选AI 开发工具
AI-first 程式碼編輯器,基於 VS Code 構建,深度整合 Claude / GPT-4o 等模型。Composer 多檔案編輯、Tab 自動補全、Agent 模式三大殺手鐧。
Claude
精选大模型应用
Anthropic 推出的 AI 助手,以長上下文(200K tokens)、對複雜任務的細膩理解、Artifacts 視覺化輸出聞名。Claude Sonnet 4.5 / Opus 4.7 在程式設計、寫作、推理多項基準上領先。
相关推荐
同类资讯 — 由发布时间排序

OpenAI 釋出 GPT-6 Astra 模型:聲稱邁入 AGI 時代的關鍵一步
OpenAI 正式推出其最強 AI 模型 GPT-6 Astra,CEO Sam Altman 稱其為"全球最佳計算機使用、專業工作、科學、程式設計及網路安全模型"。公司總裁 Greg Brockman 認為"我們現在處於 AGI 時代並非不合理",該模型在 FrontierMath Tier 4 得分 98%、ARC-AGI 3 達 99.9%,並已向 ChatGPT Plus 及企業使用者分階段開放。

OpenAI、Anthropic 與 xAI 同日宕機:各家回應不一致引發猜測
2024 年 9 月 3 日上午,OpenAI ChatGPT、Anthropic Claude 和 xAI Grok 三大前沿 AI 模型服務同時出現罕見宕機。xAI 將問題歸因於孟菲斯計算中心故障,OpenAI 稱系路由錯誤,而 Anthropic 拒絕評論具體原因。三家公司均未指向共同的第三方服務商,但時間上的巧合仍引發行業對基礎設施依賴性的關注。

Meta 推出 Muse Spark 模型差異化定價:共享資料最高降價 95%
Meta 為其新發布的 Muse Spark 代理模型推出雙軌定價策略,使用者若同意共享提示詞和模型輸出用於訓練,可享受最高 95% 的價格折扣。這一機制將資料貢獻明碼標價,反映出 AI 公司在獲取高質量訓練資料(尤其是代理工具使用資料)方面的迫切需求,同時也可能重塑企業客戶對資料共享的決策邏輯。

ChatGPT、Claude 與 Grok 同時宕機引發 GPT-6 Astra 猜測升溫
2026年9月3日,OpenAI 的 ChatGPT、Anthropic 的 Claude 以及 xAI 的 Grok 三大主流 AI 平臺幾乎同時出現服務中斷,影響網頁、移動端及 API 使用者。宕機發生時恰逢 OpenAI 在社交媒體釋出"星辰即將對齊"的神秘預告,引發業內對下一代模型 GPT-6 Astra 即將釋出的廣泛猜測。