結論から言うと、「AI診断」という分類全体を、信頼できる・できないの二択で評価することはできません。確認する単位は、特定の製品と版、使用目的、対象者、入力、出力、使う人と場所、評価方法です。

2026年8月11日に確認したPMDAの情報では、疾病の診断・治療等を目的とするプログラムの一部が医療機器として規制され、承認されたプログラム医療機器の情報が製品ごとに公開されています。一方、研究論文のモデル、一般向け生成AI、健康アプリ、医療者がAIを使う診療手順は、同じものではありません。

この記事では、医療AIの信頼性を、承認された用途、性能指標、外部検証、実際の診療での使い方、患者にとっての結果に分けます。個別の症状、診断、治療を判断する記事ではありません。現在の診療や服薬をAIの回答だけで変更しないでください。記事内の画像は概念イラストであり、実在の医療機器、検査画面、患者データ、診断結果を再現した図ではありません。

結論:AI診断は製品・用途・使う人まで分ける

古い図書館で複数の青いカードを見比べるノア、カイ、レン

「AIが病気を見つけた」という説明だけでは、何が確認されたのか分かりません。少なくとも、次の四つを分けます。

区分 確認できる入口 その情報だけでは言えないこと
国内で承認・認証等されたプログラム医療機器 製品名、使用目的、対象、入力・出力、使用者、注意事項 すべての病気や患者で正しい、AI単独で診断する、患者転帰が改善する
研究論文のAIモデル 研究対象、データ、比較、評価指標、結果 国内で流通する製品である、承認済みである、別の施設でも同じ性能になる
一般向け生成AI・健康アプリ 提供者が示す利用目的、利用規約、保存・更新条件 医療機器である、診断や緊急度判定に使える、医療者の確認が不要である
医療者とAIを組み合わせた手順 誰がいつ出力を見て、どう確認し、次の行動を決めるか AI単体の性能だけで、診療全体の安全性や有効性が決まる

したがって、「医療AIは医師の代わりか」という聞き方も広すぎます。AIが異常候補を示す製品、数値を測る製品、リスクを推定する製品では、出力の意味が違います。医療者に情報を提示する設計か、患者本人が使う設計かも、製品ごとの使用目的で確認します。

承認は「AI全体」ではなく製品ごとの使用目的

古い図書館で検査・診療・記録を表す三つのカードを見るノアとカイ

PMDAは、疾病の診断・治療等を目的とし、意図どおりに機能しない場合に生命・健康に影響するおそれがある一定のプログラムを、プログラム医療機器として説明しています。健康に関する機能があるすべてのソフトウェアを、一律に医療機器として扱うわけではありません。

承認等を確認するときは、広告の「AI搭載」「医師監修」という表示ではなく、次を製品単位で見ます。

  1. 製品名、一般的名称、製造販売業者
  2. 承認・認証等の区分と番号
  3. 使用目的または効果
  4. 対象となる患者、検査、画像、波形等
  5. 想定する使用者と使用環境
  6. 出力の意味、使えない条件、警告・注意、製品の版

PMDAの承認等情報は確認の入口になります。ただし、PMDA自身が、一覧には掲載まで時間差があり、AIを使う医療機器を網羅するものではないと注意しています。一覧に見当たらないことだけで未承認と決めず、製品の添付文書、審査報告書、製造販売業者の現行情報も照合します。

また、承認されたことと、AIが単独で診断を確定することは同じではありません。異常候補の提示、計測、読影支援、リスク推定など、承認された出力が診療のどこで使われるかを確認します。

精度の数字は対象・比較・しきい値で読む

古い図書館で医療画像と検証記録を表す複数のパネルを確認するノアとカイ

「精度90%」「専門医と同等」という見出しだけでは、信頼性を判断できません。FDAも、分類、画像の領域分割、異常箇所の検出、将来リスクの推定など、目的が違えば適切な性能指標も異なると説明しています。

指標 おもに確認すること 読むときの注意
感度 対象の状態がある人を、陽性・要確認として拾えた割合 高くしても、偽陽性が増える場合がある
特異度 対象の状態がない人を、陰性・非該当とした割合 高くしても、偽陰性との両立は製品・しきい値次第
陽性的中率・陰性的中率 その判定が出た人のうち、実際の状態と一致した割合 対象集団で病気がどの程度あるかにも影響される
AUC 複数のしきい値を通した識別性能 運用時に採用する一つのしきい値での誤りや、100人中の正解数を直接示さない

数字を見るときは、次の条件も一緒に確認します。

同じ製品でも、入力画像の品質、撮影装置、対象集団、病気の頻度、しきい値が違えば結果は変わり得ます。一つの研究の平均値を、目の前の一人の診断確率に置き換えません。

外部検証と診療ワークフローを確認する

古い図書館で人物カードの前に立つノア、カイ、レン

IMDRFは、医療機器プログラムの臨床評価を、出力と対象疾患の関係、入力から意図した出力を正確に作れるか、意図した使用場面で臨床的に意味のある結果になるか、という層に分けています。WHOも、意図した使用目的を明確にし、実際の対象や環境を代表するデータで外部検証することを重視しています。

信頼性を一段ずつ確認すると、次のようになります。

確認層 確認する問い
入力と技術出力 必要なデータを正しく受け取り、意図した出力を安定して生成するか
開発データと分けた検証 学習に使っていないデータで性能を確認したか
外部検証 別施設、別装置、別時期、対象となる集団でも評価したか
人とAIの組合せ 誰が出力を見て、誤りや評価不能をどう扱い、必要なら覆せるか
導入後の監視 入力や診療環境の変化、性能低下、不具合、更新をどう追うか

FDA、Health Canada、英国MHRAの共同原則も、AI単体だけでなく人とAIを組み合わせたチームの性能と、意図する使用者、場所、対象集団、限界の透明性を確認項目にしています。

論文の成績が良くても、診療では出力を見る時点、警告の伝わり方、確認作業、追加検査、担当者の負担が変わります。導入した施設での運用と、エラーや性能低下を報告する経路まで含めて評価します。

精度向上と患者転帰の改善は同じではない

古い図書館で人物の横顔と医療者のカードを見比べるノア、カイ、レン

AIが異常候補を多く見つけた、読影時間が短くなった、感度が上がったという結果は、それぞれ重要です。しかし、それだけで患者にとっての利益まで確認したことにはなりません。

結果の種類 例
モデル・装置の性能 感度、特異度、AUC、検出位置の一致、計測誤差
診療工程 確認時間、再検査、紹介、治療開始までの時間、医療者の負担
患者にとっての結果 症状、合併症、入院、生活機能、生活の質、死亡等
害・負担 偽陰性による遅れ、偽陽性による追加検査、不要な処置、不安、格差

ある指標が改善しても、その後の確認や治療につながらなければ患者転帰は変わらないことがあります。反対に、見つける数が増えても、追加検査や過剰な介入が増える可能性があります。

したがって、AIの性能から「医療の質が上がる」「地域格差が縮まる」「見落としが減る」と分類全体に一般化しません。何を比較し、診療工程のどこが変わり、患者にとっての利益と害を何で測ったかを別々に確認します。

一般AI・健康アプリを診断結果として使わない

古い図書館で端末と分岐する光の道を見るノア、カイ、レン

一般向け生成AIや健康アプリが病名候補や受診案内を返しても、それだけで国内の承認・認証等を受けた医療機器とは限りません。WHOは、生成AIが健康分野で、誤った、不正確な、偏った、または不完全な内容を出すリスクを挙げています。

一般AIの回答だけで、次を決めないでください。

すでにAIに相談した場合は、サービス名、日時、入力した内容、出力全文を確認できる状態にし、診断結果ではなく「こう表示されて不安になった」という情報として医療者に伝えます。健康情報を入力する前には、提供者の現行の利用目的、保存期間、第三者提供、削除方法も確認してください。

急な症状ではAIの回答を待たない

厚生労働省は「こんな時は迷わず119へ」で、成人、子ども、高齢者ごとの緊急性が高い症状を案内しています。該当する症状や、緊急性が高いと判断した場合は、AIへの入力や追加回答を待たず119番へ連絡してください。

救急車を呼ぶべきか、今すぐ病院へ行くべきか迷う場合は、実施地域では救急安心センター#7119で、医師、看護師、救急救命士等の助言を受けられます。AIの病名候補ではなく、現在の症状と変化を相談します。

AIと医療者の結果が違うときの確認順

古い図書館で点と線でつながる複数のカードを見るノア、カイ、レン

AIと医療者を二者択一にせず、まず両者が見た情報と担当範囲をそろえます。

  1. AIを特定する:医療機関の製品か一般AIか、製品・サービス名、版、使用目的を確認する。
  2. 入力と出力を残す:いつ、何を入力し、どの文・数値・画像領域が出力されたか記録する。
  3. 対象範囲を確認する:自分の年齢、状態、検査条件、使用場所が想定範囲に入るか確認する。
  4. 差の理由を質問する:診察、別の検査、経過、薬、持病等のうち、何を踏まえて説明が異なったか聞く。
  5. 次の行動を決める:追加検査の要否、経過を見る期間、変化したときの症状と連絡先を確認する。

質問例は、次のように具体化できます。

このAIは、何を入力して何を示す製品・サービスですか
私の状態は、想定された対象に含まれますか
AIの表示と今回の判断が違う理由を教えてください
追加の検査や別の診療科を考える条件は何ですか
どの変化があれば、いつ、どこに連絡しますか

説明を聞いても判断材料が不足する場合は、検査結果や記録を受け取り、別の医療者に相談する方法を確認できます。ただし、急な重い症状があるときは、この確認作業より119番等の緊急導線を優先します。

新しいAI診断の発表を確認する表

古い図書館で人物カードから相談先へ伸びる光の道を見るノア、カイ、レン

ニュース、広告、論文、医療機関の案内を見たときは、次の欄を埋めます。埋まらない欄は、性能が低いと決める材料ではなく、まだ確認できていないこととして残します。

確認欄 記録する内容
情報の種類 研究計画、研究結果、承認・認証等、販売案内、導入報告のどれか
製品 製品名、一般的名称、製造販売業者、版
使用目的 対象疾患、患者、入力、出力、使う人、場所
データ 人数、施設、時期、装置、除外例、対象集団の特徴
比較 AI単独、医療者単独、人とAI、従来手順のどれを比較したか
性能 指標名、しきい値、信頼区間、偽陽性、偽陰性、評価不能
外部検証 開発とは別の施設・時期・集団で確認したか
診療工程 誰が出力を確認し、誤り・不一致・更新にどう対応するか
患者転帰 症状、合併症、入院、機能、生活の質、死亡、追跡期間
害・公平性 追加検査、遅延、不安、対象外集団、アクセス差、不具合
現行性 確認日、情報更新日、製品の版、承認情報・添付文書

論文があること、性能指標が高いこと、承認されたこと、医療機関に導入されたこと、患者転帰が改善したことは、同じ意味ではありません。情報の段階を一つずつ進めて確認します。

未来分岐点:自分の生活で選ぶこと

AI診断のどの情報を確認すれば、特定の用途での信頼性と限界を判断できるのか

まずは「AI診断 信頼できる」を調べる場面で、未確認の条件を一つだけ書き出してみてください。

AI診断の信頼性は、AIという名称ではなく、特定の製品・版・使用目的・評価条件で確認します。

個別の症状や治療については、医師、薬剤師等の該当する専門職に相談してください。

確認した一次・公式情報

記事の理解を深めるために参照した、または確認先として役立つ資料です。必要に応じてリンク先の最新情報も確認してください。