第三者による診療録レビューをAIで拡張する
前の記事「 データに基づく標的型デ・インプリメンテーションを日本の医療政策へ」では、レセプトデータの役割を次のように位置づけました。
レセプトは、査定対象を自動的に決定する装置ではなく、追加確認と改善支援の優先順位を決めるスクリーニング装置である。
レセプトからは、どの医療機関で、どの検査や処方が多いかを把握できます。しかし、患者の症状、診察所見、治療経過、検査を選んだ理由までは十分に分かりません。
したがって、レセプト上の外れ値を見つけた後には、診療録を確認する必要があります。
問題は、この診療録レビューに大きな費用と人手がかかることです。
医師や看護師などの専門職が、一件ずつ長い診療録を読み、必要な情報を探し、適応の有無を判断する作業を続けるなら、確認できる症例数は限られます。全国規模で実施することも現実的ではありません。
そこで提案したいのが、 AIを活用した第三者による診療録レビュー です。
ただし、AIに「この診療は不適切である」と最終判定させるのではありません。
AIを最初の読み手として使い、人間の専門家が最終判断を行う。
この役割分担が基本になります。
レセプトと人間の間に、AIという第二のスクリーニングを置く
AIを活用した診療録レビューは、次のような三段階で構成できます。
第1段階:レセプトで対象を絞る
まず、レセプトデータから、低価値医療の実施率が持続的に高い可能性のある医療機関を抽出します。
単純な件数ではなく、患者数、年齢、併存疾患、診療科、施設規模などを調整し、同じ条件の医療機関と比較します。
ここで選ばれるのは、「不適切な医療機関」ではありません。
あくまで、追加確認の優先度が高い医療機関です。
第2段階:AIが診療録から判断材料を抽出する
対象となった医療機関の診療録から一定数の症例を抽出し、AIに読ませます。
AIに求めるのは、自由な医学的意見ではなく、あらかじめ決められた項目の抽出です。
例えば、急性腰痛に対する早期画像検査を評価する場合には、次のような情報を整理させます。
- 外傷歴の記載
- 悪性腫瘍の既往
- 発熱や感染徴候
- 神経学的異常
- 膀胱直腸障害
- 症状の持続期間
- 保存的治療の経過
- 検査を行った理由
- 経過観察や再診方針
- 判断の根拠となった診療録上の記載箇所
重要なのは、AIに結論だけを出させないことです。
例えば、
「低価値医療である可能性が高い」という回答だけでは、第三者は検証できません。
AIには、
「2026年4月10日の診療録に外傷なしと記載されている」
「神経脱落所見の有無は記載されていない」
「悪性腫瘍既往については確認できない」
というように、 根拠となる記載と情報の欠落を分けて提示させる 必要があります。
第3段階:人間の専門家が最終判断する
AIが整理した情報を、第三者の医師や多職種チームが確認します。
最終的には、
- 適応があった
- 適応が乏しかった
- 記載不足で判断できない
- 指標の定義では評価できない例外症例
などに分類します。
AIが行うのは判決ではなく、証拠の整理です。
最終的な適切性の判断、医療機関へのフィードバック、査定や指導の要否は、人間が責任を持って決定します。
AIは診療録の要約より構造化に向いている
診療録レビューにAIを導入する際、単に「このカルテを要約してください」と依頼するのは危険です。
自由な要約では、AIが重要と考えた情報だけが選ばれ、都合の悪い情報や例外条件が抜ける可能性があります。
より安全なのは、評価項目を事前に固定し、構造化された形式で回答させることです。
例えば、出力を次のように限定します。
AIによる診療録レビューの出力項目
- 対象となる診療行為
- ガイドライン上の例外条件
- 診療録に記載された該当所見
- 記載されていない重要所見
- 検査・処方の理由
- 代替診療や経過観察の有無
- 根拠となる記載日時と原文
- AIの確信度
- 人による確認が必要な論点
また、AIには次の原則を守らせます。
- 提示された診療録以外の情報を推測しない
- 記載がないことを「異常なし」と解釈しない
- 過去歴と現在の症状を区別する
- 肯定所見と否定所見を区別する
- 不明な場合は「不明」と回答する
- すべての判断に診療録上の根拠を付ける
この設計により、AIは「臨床判断を代行する存在」ではなく、「大量の文書から必要な情報を拾い上げる存在」になります。
AIを使うことで期待できる効果
1.より多くの症例を確認できる
人間だけで診療録を読む場合、確認できる症例数は限られます。
AIが事前に情報を整理すれば、人間は重要な症例や判断の難しい症例に時間を集中できます。
電子診療録の自由記載から、人生の最終段階に関する話し合いの記録を抽出した研究では、自然言語処理で対象を絞った後に人間が確認する方法により、従来の全件レビューと比べて作業時間を大きく削減しながら、92.6%の感度を維持できました。( ジャーナルネットワーク)
また、心不全患者の臨床試験参加条件を確認したランダム化試験では、AIを利用した群では、完了できた患者の99%以上について15日以内に適格性を判定できたのに対し、人による従来法では50日以内でした。( ジャーナルネットワーク)
目的は異なりますが、AIが診療録の事前確認を担うことで、人間のレビューを高速化できる可能性を示しています。
2.判断材料を標準化できる
人による診療録レビューでは、確認者によって注目する情報や評価基準が異なることがあります。
AIに同じ評価項目、同じ定義、同じ出力形式を使用させれば、少なくとも情報抽出の方法は標準化できます。
敗血症患者約10万人の入院記録から症状を抽出した研究では、AIは医師による診療録レビューを基準として、99.3%の正確度、99.6%の特異度を示し、医師間の一致度に近い性能を示しました。ただし感度は69.7%であり、見逃しが残ることにも注意が必要です。( ジャーナルネットワーク)
この結果は、AIが大量の診療録から特定情報を抽出することには適している一方、AIだけですべての症例を除外することは危険であると示しています。
3.レセプトでは分からない例外を拾える
レセプト上は同じ画像検査でも、実際には、
- 外傷後の検査
- 悪性腫瘍既往患者の検査
- 症状が長期化した後の検査
- 他院から依頼された検査
- 神経学的異常を認めた患者の検査
などが混在しています。
AIによって診療録からこれらの例外条件を抽出できれば、レセプトだけで行う評価より誤判定を減らせます。
複数疾患の症例判定に大規模言語モデルを用いた研究では、感度は78~98%、特異度は48~98%と、疾患、モデル、指示方法によって性能が大きく変わりました。( PubMed)
これは、診療録情報を使うことで判定を改善できる可能性と同時に、対象ごとの事前検証が不可欠であることを示しています。
4.医療機関への説明可能性が高まる
単に「画像検査率が高い」と通知されても、医療機関は納得しにくいでしょう。
一方、
- 30症例中18症例では危険徴候の記載が確認できなかった
- 12症例では検査理由が診療録上明示されていなかった
- 10症例では再診による経過観察が選択肢として提示されていなかった
という形で示せれば、改善すべき診療プロセスが明確になります。
AIレビューは、処罰のためだけではなく、医療機関が自ら診療を見直すための材料として使えます。
最大の課題は「AIが間違えること」だけではない
1.もっともらしい誤りを作る
生成AIは、診療録に存在しない情報を補ってしまうことがあります。
また、否定表現、過去の症状、家族歴、他院記録などを現在の患者所見と取り違える可能性があります。
臨床記録からの情報抽出を扱った研究でも、詳細な指示がなければ精度と一貫性が低下し、否定表現や文脈依存の用語の処理に問題が残ると指摘されています。( ジャーナルネットワーク)
そのため、AIの回答には必ず診療録上の引用箇所を付け、第三者が原文へ戻れるようにしなければなりません。
2.「記載なし」と「所見なし」を混同する
診療録に発熱の記載がないからといって、発熱がなかったとは限りません。
医師が診察して異常なしと判断したものの、記載しなかった可能性があります。
逆に、診療録に記載されている病名が、実際の臨床判断を正確に表しているとも限りません。
AIは、存在する文書を読むことはできますが、記録されなかった臨床情報を復元することはできません。
したがって、AIレビューによって評価できるのは、
診療の適切性そのもの
だけではなく、
診療録上、適切性を裏付ける情報が確認できるか
という側面を含みます。
診療そのものの問題と、記録の問題を分けて評価する必要があります。
3.AIの結論に人間が引きずられる
人が最終判断する仕組みにしても、それだけで安全とは限りません。
AIが先に「低価値医療の可能性が高い」と表示すると、人間の確認者がその結論に引きずられる、いわゆる自動化バイアスが生じます。
対策として、AIには最終評価を表示させず、まず事実の抽出だけを行わせる方法が考えられます。
人間のレビュー担当者は、
- 診療録の重要部分を確認する
- 自ら暫定評価を行う
- その後にAIが抽出した情報を見る
という順序にした方が、AIへの過度な依存を抑えやすくなります。
4.医療機関や患者集団によって性能が変わる
診療録の書き方は、医療機関、診療科、電子カルテ、医師によって異なります。
略語、定型文、コピーされた記載、音声入力の誤変換などもあります。
ある病院で高い精度を示したAIが、別の地域や診療科でも同じ性能を示すとは限りません。
医療AIの実装指針であるFUTURE-AIでは、公平性、汎用性、追跡可能性、使いやすさ、頑健性、説明可能性という六つの原則を、開発から導入後の監視まで一貫して評価することが提案されています。( BMJ)
導入前には、施設別、診療科別、患者属性別に性能を検証する必要があります。
5.患者情報の保護が必要になる
診療録には、極めて機微性の高い個人情報が含まれます。
一般向けの生成AIサービスに、そのまま診療録を入力する運用は避けなければなりません。
AIレビューを行う場合には、少なくとも、
- 医療機関または委託先が管理する閉域・専用環境
- 入力データがモデル学習に再利用されない契約
- 保存期間と削除方法の明確化
- 通信・保存データの暗号化
- 利用者ごとのアクセス制御
- 操作履歴と出力履歴の保存
- 必要最小限のデータだけを扱う仕組み
- 委託先に対する監督と責任分担
が必要です。厚生労働省は2026年6月に「医療情報システムの安全管理に関するガイドライン第7.0版」を公表し、医療機関に遵守を求めています。改定作業では、生成AIやクラウドサービスによる医療情報の取扱い拡大も背景として挙げられました。( 厚生労働省)
AIレビューを制度化するための七つの条件
第三者によるAI診療録レビューを実際の政策として導入するなら、次の条件が必要です。
1.対象となる低価値医療を限定する
最初からすべての検査や処方を対象にしてはいけません。
エビデンスが比較的確実で、例外条件が定義でき、診療録から判断材料を抽出しやすい項目から始めます。
2.AIの役割を情報抽出と優先順位づけに限定する
AIに、査定、行政処分、保険医指定取消しなどの最終判断をさせてはいけません。
AIは、症例を、
- 根拠が明確に記載されている
- 根拠が確認できない
- 判断が難しい
というように整理し、人間のレビュー対象を絞ります。
3.出力には必ず原文の根拠を付ける
AIが示した情報について、どの診療録のどの部分に根拠があるのかを確認できるようにします。
根拠を追跡できない回答は、評価に使用しません。
4.AIが陰性とした症例も無作為に確認する
AIが「問題なし」と判断した症例を一切確認しなければ、見逃し率を把握できません。
陽性例だけでなく、陰性例からも一定割合を無作為抽出し、人間が確認します。
5.医療機関に異議申立ての機会を保障する
診療録だけでは把握できない事情や、地域特有の医療提供体制があるかもしれません。
医療機関が追加資料を提出し、評価の再検討を求められる仕組みが必要です。
6.AIの性能を継続的に監視する
AIモデルや電子カルテの仕様が変われば、精度も変化します。
感度、特異度、陽性的中率、陰性的中率に加えて、患者属性別の誤判定率を継続的に測定します。
医療AIは、導入前の精度だけでなく、実際の運用中の人間との相互作用、安全性、業務への影響を評価する必要があります。DECIDE-AIは、初期の臨床導入において実際の性能、安全性、ヒューマンファクターを評価することの重要性を示しています。( Nature)
7.第三者機関の独立性を確保する
AIを運用する組織が、医療費削減額によって報酬を得る仕組みでは、過剰な低価値判定を行う誘因が生まれます。
レビュー機関の評価指標は、査定額ではなく、
- 判定精度
- 再現性
- 異議申立て後の取消率
- 必要医療への影響
- 医療機関の改善率
- 患者安全
で設計すべきです。
現実的な実証事業の形
日本で最初に実施するなら、全国一斉導入ではなく、限定された実証事業が適切です。
例えば、一つの低価値医療指標について、複数地域の医療機関を対象に、次の三つの方法を比較します。
- レセプトだけによる評価
- 人間だけによる診療録レビュー
- AIで情報を抽出し、人間が確認するレビュー
比較する項目は、
- 一症例当たりの確認時間
- 医師間の判定一致率
- AIと専門家の一致率
- 見逃し率
- 誤って問題ありとされた割合
- 医療機関からの異議申立て率
- 改善後の低価値医療実施率
- 必要医療や患者安全への影響
です。
AIの正確度だけを検証するのではなく、 AIを組み込んだ審査制度全体が、従来より安全で、公平で、効率的か を評価しなければなりません。
AIは第三者の代わりではなく、第三者を成立させる基盤になる
低価値医療対策に第三者による診療録レビューを導入することには、臨床的な妥当性があります。
しかし、人間だけで全国の診療録を確認することは現実的ではありません。
AIは、この困難を解決する可能性があります。
大量の診療録から必要な所見を探し、例外条件を整理し、判断が必要な症例を人間に提示する。
これにより、少数の専門家でも、より多くの症例を一定の基準で確認できるようになります。
ただし、AIを「医療の適切性を判定する第三者」として扱ってはいけません。
AIは第三者レビューを置き換えるのではなく、第三者レビューを現実的な規模で成立させるための基盤である。
この位置づけが重要です。
レセプトで対象を見つける。
AIが診療録から判断材料を整理する。
人間の専門家が臨床的妥当性を判断する。
医療機関には説明と異議申立ての機会を保障する。
そして、査定額ではなく、診療の改善と患者安全を評価する。
この仕組みであれば、AIは低価値医療を機械的に切り捨てる道具ではなく、必要な医療を守りながら、不要な医療を丁寧に見直すための道具になり得ます。
参考文献
Lee RY, Brumback LC, Lober WB, et al. Assessment of Natural Language Processing of Electronic Health Records to Measure Goals-of-Care Discussions as a Clinical Trial Outcome. JAMA Network Open. 2023;6(3):e231204. doi:10.1001/jamanetworkopen.2023.1204.
Pak TR, Sánchez SM, McKenna CS, Rhee C, Klompas M. Syndromic Analysis of Sepsis Cohorts Using Large Language Models. JAMA Network Open. 2025;8(9):e2532188.
Schuemie MJ, et al. Standardized Patient Profile Review Using Large Language Models for Case Adjudication in Observational Research. NPJ Digital Medicine. 2025;8:32. doi:10.1038/s41746-025-01433-4.
Unlu O, Varugheese M, Shin J, et al. Manual vs AI-Assisted Prescreening for Trial Eligibility Using Large Language Models—A Randomized Clinical Trial. JAMA. 2025;333(12):1084-1087. doi:10.1001/jama.2024.28047.
Burford KG, et al. Accuracy, Consistency, and Hallucination of Large Language Models When Analyzing Unstructured Clinical Notes in Electronic Medical Records. JAMA Network Open. 2024;7(8):e2425953.
Lekadir K, Feragen A, Fofanah AJ, et al. FUTURE-AI: International Consensus Guideline for Trustworthy and Deployable Artificial Intelligence in Healthcare. BMJ. 2025;388:e081554. doi:10.1136/bmj-2024-081554.
Vasey B, Nagendran M, Campbell B, et al. Reporting Guideline for the Early-Stage Clinical Evaluation of Decision Support Systems Driven by Artificial Intelligence: DECIDE-AI. Nature Medicine. 2022;28:924-933. doi:10.1038/s41591-022-01772-9.
World Health Organization. Ethics and Governance of Artificial Intelligence for Health: Guidance on Large Multi-Modal Models. WHO; 2025.
厚生労働省.医療情報システムの安全管理に関するガイドライン第7.0版.2026年6月.
厚生労働省.第25回健康・医療・介護情報利活用検討会 医療等情報利活用ワーキンググループ議事録.2025年7月24日。