Positioning

의료 LLM 평가 보고

n=31
스코핑 리뷰 구조 →repo ↗

내 기획의 좌표

A Reproducibility and Temporal Validity Framework for Evidence Synthesis of Medical LLMs

Beyond PRISMA: 빠르게 변하는 의료 LLM을 위한 근거종합 프레임워크

기존 근거종합(PRISMA-ScR)은 개입이 시간에 대해 안정적이라고 전제한다. 그러나 의료 LLM에서 "GPT-4가 MedQA에서 90점"은 하나의 관측이 아니라 특정 시점·특정 계산 구성에서 나온 측정값이다 — Result = f(Model, Version, Prompt, Sampling, Benchmark, Contamination, Tools, Date, Provider). 따라서 근거의 단위를 논문에서 (연구 × 모델버전 × 실험구성 × 평가) 로 분해하고, 근거에 시간적 유효성을 명시해야 한다.

"의료 AI용 PRISMA를 만든다"는 기획은 폐기했다. PRISMA-ScR 개정 진행 중, PRISMA-LSR, TRIPOD-LLM, REFINE, CHART, READY가 이미 그 자리를 채웠다. 대상을 벤치마크·체크리스트에서 근거의 시간적 유효성과 재현성으로 올린다.

열려 있는 자리

  • PRISMA-ScR 개정이 지금 열려 있다개정 프로토콜(JBI 2025)이 포함 기준으로 "보고 완전성을 평가한 연구"를 명시하고 "포함 후보 항목 목록"을 수집한다. 즉 내가 의료 LLM 리뷰의 보고 완전성을 실측하면 그 자체가 개정의 입력 자격을 갖는다. 새 지침을 처음부터 만드는 것보다 훨씬 현실적이다.
  • living의 절반은 이미 승인됐다PRISMA-LSR이 "리뷰는 살아 있어야 한다"를 방법론계에 통과시켰다. 내가 더할 것은 "개입도 변한다" — LSR은 근거의 유입을 관리하고, 내 프레임워크는 개입의 변이를 관리한다.
  • READY는 데이터셋 층이다READY의 대상은 벤치마크 데이터셋이고 축이 정적이다. model drift·API 변경·stochasticity·prompt sensitivity·contamination·saturation·judge 편향·agent/RAG·비용·종단평가가 중심축에 없다. 저자들 스스로 "표준 보고 관행이 부족하다"고 인정한다.
  • 자동 평가 축이 비어 있다QUEST(npj 2025)는 인간 평가에 한정된다. LLM-as-judge 논문들이 ICC 0.818 / Pearson 0.87 / 승률 66%로 각자 다른 지표로 타당성을 주장하는데, 이를 보고 항목으로 요구하는 지침이 확인되지 않는다.
  • 시간 구간이 비어 있다JAMA 리뷰는 2024-02, BMC 스코핑 리뷰는 2023-09에서 끊긴다. reasoning model·agent·RAG·long context·structured output·tool calling 시대는 아무도 매핑하지 않았다.

먼저 치워야 하는 것

  • READY (npj 2026) — 중복 50~60%같은 팀(Lee J·Shin J)이 BMC 2024 → npj 2026으로 2단 완주했다. 내 1순위 저널이고 박사 연구의 일부다. 같은 층위에서 경쟁하면 3번째 주자가 된다. 층위를 올리는 것이 유일한 해법.
  • REFINE (2026)44항목·6섹션·Delphi 54명. 원문에서 기술 요소가 어디까지 들어갔는지 확인하기 전에는 기획을 확정할 수 없다. 최우선 확인 항목.
  • PRISMA-AI 개발 중EQUATOR에 healthcare AI systematic review용 PRISMA extension이 개발중으로 등재돼 있다는 정보 . 사실이면 내 자리와 정면 충돌할 수 있다.
  • PRISMA-ScR 개정팀이 먼저 넣을 수 있다개정 사유로 "자동화(automation) 진화"를 직접 들었다. AI 항목을 스스로 넣으면 내 기여가 줄어든다. 개정 진행 상황 추적이 필요하다.
  • Lancet Digit Health 2025 지형 논문PubMed에 초록이 없다. 원문을 읽어야 서론 프레이밍을 정할 수 있다.

핵심 개념 — 기존 근거종합에 없는 것

Evidence Half-lifeAI 연구 결과가 현재 기술 상태를 대표한다고 볼 수 있는 기간. 기존 근거종합에 없던 지표.
Model Generation Lag현재 세대 − 평가된 세대. 논문이 나오는 시점에 대상 모델이 이미 몇 세대 전인가.
Publication LagT(publication) − T(evaluation). 실험 시점과 게재 시점의 간격.
Version-aware Evidence Map논문 목록이 아니라 (연구 ↔ 모델버전 ↔ 벤치마크) 관계 그래프. MLOps model registry·git versioning·data provenance에서 차용.
Temporal statusActive / Superseded / Deprecated / Unavailable / Reproduced / Not reproducible. 기존 의료 근거종합에 거의 없는 관점.

근거 단위의 5개 층

L1 Evidence논문·저자·연도·임상영역·설계·데이터셋·결과 — 기존 PRISMA 영역
L2 AI Systemprovider·모델·버전·공개/비공개·출시일·접근일·모달리티·컨텍스트 길이·파인튜닝
L3 Inference Configprompt·system prompt·temperature·top-p·seed·few-shot·반복 횟수
L4 Evaluation벤치마크 버전·오염 위험·공개/비공개·인간 평가자·LLM judge(+judge 버전)·평가자 간 일치도·blind 여부
L5 Temporal실험 수행일·모델 폐기 여부·벤치마크 노후도·재현 시점·현재 접근 가능성

논문 프로그램 — 순서가 전략이다

  1. Study 1Are current frameworks adequate for rapidly evolving medical AI?

    의료 LLM 스코핑 리뷰 ~100편을 모아 model version·access date·prompt·inference config·RAG·tool use·benchmark version·contamination·model replacement·temporal limitation 보고율을 실측. PRISMA-ScR·TRIPOD+AI·TRIPOD-LLM·CONSORT-AI·CLAIM·STARD-AI·REFINE와 coverage matrix로 비교. 산출: 기존 프레임워크가 temporal/version 차원을 표현하지 못한다는 실증.

    여기부터 시작한다. Delphi가 필요 없고, PRISMA-ScR 개정의 포함 기준에 그대로 맞는다.

  2. Study 2Framework 개발

    Study 1의 gap으로 Delphi. 패널 구성: 의료정보학·임상의·근거종합 방법론가·ML 연구자·LLM 연구자·생물통계. 산출: Minimum Information for Medical AI Evidence Synthesis.

    PRISMA-ScR도 Delphi 31명이 필요했다 — Study 1 없이 바로 여기로 가면 규모에서 막힌다.

  3. Study 3Validation

    같은 의료 LLM 문헌을 PRISMA-ScR 방식 vs 내 프레임워크로 각각 정리해 head-to-head 비교(재현성·시간적 유효성·모델 비교 가능성·벤치마크 추적·갱신 용이성).

    READY가 전문가 5명 적용으로 닫은 것과 같은 층위의 마무리. 이게 있어야 "또 하나의 체크리스트"가 아니게 된다.

투고 전략

기본 경로npj Digital Medicine — 일반 submission을 기본값으로. Collection은 필수가 아니며 IF는 저널 단위로 동일하다(Collection별로 다르지 않다).
Collection"Prospective and Interventional Clinical Evidence in Medical AI Research" (마감 2027-03-24)는 scope에 generative AI의 clinical workflow 통합, model drift·safety·retraining·recalibration governance, reporting·governance·lifecycle framework, accuracy를 넘는 평가를 명시한다. 내 논문을 "model output → clinical action → outcome"까지 닫는 형태로 설계하면 자연스럽게 맞는다.
주의npj는 off-the-shelf 모델을 돌려 성능만 비교한 연구는 통상 고려하지 않는다고 명시한다. 임상 application·validation·implementation·efficacy를 요구한다. Collection 논문도 일반 논문과 동일한 심사 기준이 적용된다 — 합격률 버프가 아니라 editorial fit·visibility의 문제다.
Article typeArticle / Review / Analysis / Perspective 중 선택. 방법론 프레임워크는 Article 또는 Analysis 계열이 자연스럽다. 스코핑 리뷰는 Review가 아니라 Article로 투고한다(저널 규정).

j/k 이동 · / 검색 · 1필독 2읽음 3제외 · Esc 검색 해제 · 선택한 논문은 주소에 남으므로 URL 로 공유할 수 있다

묶음 / 연도
2016
2017
2018
2019
2020
2021
2022
2023
2024
2025
2026
지침 파편화 지형
LLM 보고 지침 본체
선행 AI 보고 지침
의료 LLM 평가 실태 매핑
framework·taxonomy 제안
LLM-as-judge · 자동 평가
근거종합 방법론 본체
보고 품질 감사
위협 3 치명 2 주의 1 낮음 0 영향 없음왼쪽 테두리 = 위협도 · 가로축 = 발행 연도
논문관계위협연도저널규모남긴 공백
Reporting checklist for foundation and large language models in medical research (REFINE): an international consensus guideline
경쟁위협 3/32026Diagn Interv Radiol
개발군 57명/17개국, 패널 54명/16개국이 R1·R2 완료. 최종 44항목 6섹션
게재지가 영상의학 전문지다. 일반 의료 LLM 커뮤니티에서의 채택률은 미지수이며, 채택 실태 자체가 연구 대상이 될 수 있다.
Structured taxonomy and framework for developing medical benchmark in large language models derived from scoping review (READY)
경쟁위협 3/32026NPJ Digit Med
벤치마크 55편. 도메인 전문가 5명이 독립 적용해 일관된 평가자 간 일치도 확인
대상이 벤치마크 데이터셋이다 — 연구도, 근거도 아니다. 그리고 축이 정적이다: model versioning·drift, API 변경, stochasticity, prompt sensitivity, contamination, benchmark saturation, LLM-as-judge 편향, agent/RAG/tool-use, 비용·지연, 종단 평가, closed model 재현성이 중심축에 없다. 저자들 스스로 Discussion에서 "LLM으로 벤치마크를 만드는 방법론 자체가 아직 미성숙하고, 기존 벤치마크 연구 간 표준 보고 관행이 부족하다"고 인정한다.
Navigating the landscape of medical artificial intelligence reporting guidelines
경쟁위협 3/32025Lancet Digit Health
해당 없음
지형을 서술하는 것과, 그 지형에서 무엇이 빠졌는지를 데이터로 보이는 것은 다르다. 후자는 아직 열려 있을 가능성이 있다.
The TRIPOD-LLM reporting guideline for studies using large language models
경쟁위협 3/32025Nat Med
19개 main item + 50개 subitem. 전 범주 공통 14 main / 32 subitem
living document라고 스스로 선언했다는 것은, 갱신의 근거를 제공하는 연구에는 자리가 있다는 뜻이다. 즉 대체가 아니라 입력이 되는 경로.
Analyzing evaluation methods for large language models in the medical field: a scoping review
방법틀위협 3/32024BMC Med Inform Decis Mak
142편
검색 기간이 2023년 9개월뿐이고 DB 3개다. GPT-4 이후, agent·RAG·멀티모달 시대는 전혀 포함되지 않았다. 2티어 게재.
Holistic evaluation of large language models for medical tasks with MedHELM
경쟁위협 2/32026Nat Med
5개 범주 / 22개 하위범주 / 121개 태스크. 37개 평가. 프런티어 LLM 9종 비교
태스크 taxonomy이지 보고 항목 taxonomy가 아니다. 무엇을 평가할지를 정리했지, 평가를 어떻게 보고할지는 다루지 않는다.
Reporting Guideline for Chatbot Health Advice Studies: The CHART Statement
경쟁위협 2/32025JAMA Netw Open
Delphi 이해관계자 531명, 동기 패널 48명. 최종 12항목 39subitem
범위가 챗봇 건강조언에 한정된다. EHR 연동·agent·retrieval·멀티모달은 범위 밖.
Reporting guideline for the use of Generative Artificial intelligence tools in MEdical Research: the GAMER statement
경쟁위협 2/32025BMJ Evid Based Med
26개국 전문가 51명 참여(Delphi 설문 44명). 최종 9항목
연구 도구로서의 GAI 사용 보고이지, 연구 대상으로서의 의료 LLM 평가 보고가 아니다.
Testing and Evaluation of Health Care Applications of Large Language Models: A Systematic Review
분모위협 2/32025JAMA
519편
2024년 2월까지다. 그 이후의 agent·retrieval·멀티모달 평가와 LLM-as-judge 확산은 잡히지 않았다. 또 "무엇이 부족한지"는 밝혔지만 보고 항목 수준의 처방은 내지 않았다.
Knowledge-Practice Performance Gap in Clinical Large Language Models: Systematic Review of 39 Benchmarks
분모위협 2/32025J Med Internet Res
3,917건 스크리닝 → 39개 벤치마크. 총 230만+ 문항, 45개 언어, 172개 전문과
벤치마크를 단위로 했기 때문에, 개별 평가 연구의 절차 보고(반복측정·채점자·프롬프트)는 대상이 아니다.
A framework for human evaluation of large language models in healthcare derived from literature review (QUEST)
선례위협 2/32025NPJ Digit Med
142편 리뷰
인간 평가에 한정된다. LLM-as-judge, 자동 평가, agent 평가, 재현성·버전 관리 같은 기술 요소는 대상이 아니다.
Large Language Models for Chatbot Health Advice Studies: A Systematic Review
선례위협 2/32025JAMA Netw Open
챗봇 건강조언 한정.
Automating expert-level medical reasoning evaluation of large language models (MedThink-Bench)
방법틀위협 1/32026NPJ Digit Med
500개 고난도 문항, 10개 의학 도메인, 전문가 작성 단계별 rationale 동반
단일 벤치마크. 이런 상관계수·시간 절감 보고가 표준화되어 있지 않다.
What to Report? A Systematic Review of Medical AI Reporting Guidelines: Preliminary Results
경쟁위협 1/32025Stud Health Technol Inform
9편 — 임상·비임상 DB 양쪽
9편 예비 결과. 전수 규모, 기술 요소 축의 부재를 정량화하지 않았다. 프로시딩이라 1티어 인용 무게가 가볍다.
FUTURE-AI: international consensus guideline for trustworthy and deployable artificial intelligence in healthcare
토대위협 1/32025BMJ
원칙 수준이라 LLM 평가의 구체적 방법 항목(반복측정, 채점자 수, 프롬프트 기록)까지 내려가지 않는다.
A systematic review of large language model (LLM) evaluations in clinical medicine
분모위협 1/32025BMC Med Inform Decis Mak
761편
분류 수준에 머무르고 보고 항목 처방으로 가지 않는다.
Standardizing and Scaffolding Health Care AI-Chatbot Evaluation: Systematic Review (HAICEF)
방법틀위협 1/32025JMIR AI
266건 → 152건 스크리닝 → 전문 21건 → 프레임워크 11개 포함. 질문 356개 → 중복제거·관련성 검토 후 271개
챗봇 한정, JMIR AI 게재.
Evaluating clinical AI summaries with large language models as judges
방법틀위협 1/32025NPJ Digit Med
실제 EHR 다문서 요약
요약 태스크 하나. 그리고 이런 검증 절차(ICC·CI·인간 대조)를 보고하도록 요구하는 지침은 아직 없다.
Update to the PRISMA guidelines for network meta-analyses and scoping reviews and development of guidelines for rapid reviews: a scoping review protocol
진입구위협 1/32025JBI Evid Synth
PRISMA-NMA·PRISMA-ScR 개정 + PRISMA-RR 신규 개발. 언어 제한 없음, 2인 독립 스크리닝·추출
프로토콜이다 — 아직 결과가 나오지 않았다. 그리고 포함 기준이 "보고 완전성을 평가한 연구"다. 즉 내가 의료 LLM 리뷰의 보고 완전성을 실측하면 그 자체가 이 개정의 입력 자격을 갖는다.
Randomised controlled trials evaluating artificial intelligence in clinical practice: a scoping review
선례위협 1/32024Lancet Digit Health
AI RCT 86건
RCT만 대상. LLM 평가 연구 대다수는 RCT가 아니다.
Artificial intelligence for surgical scene understanding: a systematic review and reporting quality meta-analysis
선례위협 0/32026NPJ Digit Med
188편
수술 장면 이해라는 좁은 영역.
The STARD-AI reporting guideline for diagnostic accuracy studies using artificial intelligence
토대위협 0/32025Nat Med
진단 정확도 설계에 한정.
A framework to assess clinical safety and hallucination rates of LLMs for medical text summarisation
선례위협 0/32025NPJ Digit Med
요약 한정.
TRIPOD+AI statement: updated guidance for reporting clinical prediction models that use regression or machine learning methods
토대위협 0/32024BMJ
생성형·대화형 모델의 평가 절차(프롬프트, 반복측정, 채점자)는 대상이 아니다.
A critical assessment of using ChatGPT for extracting structured data from clinical notes
방법틀위협 0/32024NPJ Digit Med
폐암 병리보고서 1,000+건, 소아 골육종 191건
단일 연구의 좋은 관행이지, 요구사항이 아니다.
Conceptualizing the reporting of living systematic reviews
방법틀위협 0/32023J Clin Epidemiol
변하는 것이 "근거"이지 "개입 자체"가 아니다. 새 논문이 나오는 것을 다루지, 평가 대상 모델이 사라지거나 교체되는 상황은 다루지 않는다. 바로 그 지점이 의료 LLM의 문제다.
Reporting guideline for the early-stage clinical evaluation of decision support systems driven by artificial intelligence: DECIDE-AI
토대위협 0/32022Nat Med
CDSS 초기 임상 평가에 한정.
Reporting guidelines for clinical trial reports for interventions involving artificial intelligence: the CONSORT-AI extension
토대위협 0/32020Nat Med
RCT 형식에 묶여 있어, 시험이 아닌 벤치마크·오프라인 평가는 범위 밖.
Artificial intelligence versus clinicians: systematic review of design, reporting standards, and claims of deep learning studies
방법틀위협 0/32020BMJ
2019년까지, 영상 딥러닝 한정.
PRISMA Extension for Scoping Reviews (PRISMA-ScR): Checklist and Explanation
토대위협 0/32018Ann Intern Med
20개 필수 항목 + 2개 선택 항목. Delphi 1차 31명 참여, 최종 24명이 3차 완료
2018년 프레임워크다. 문헌 한 편을 안정적인 최소 분석 단위로 전제한다. 같은 이름의 기술이 같은 개입이라고 암묵적으로 가정하며, 모델 버전·접근 시점·프롬프트·추론 설정 같은 실험 provenance를 요구하지 않는다.
Guidelines for Developing and Reporting Machine Learning Predictive Models in Biomedical Research: A Multidisciplinary View
토대위협 0/32016J Med Internet Res
LLM 이전 시대.
20265
  • 경쟁위협 3/3Diagn Interv Radiol · 2026

    Reporting checklist for foundation and large language models in medical research (REFINE): an international consensus guideline

    (steering committee 외 57명, 17개국)

    2026년에 또 하나. 44항목·6섹션·modified Delphi·54명 패널. 내가 하려던 것과 형태가 거의 같다.

    설계
    modified Delphi 2라운드 + post-Delphi harmonization. 프로토콜 사전 등록·공개
    규모
    개발군 57명/17개국, 패널 54명/16개국이 R1·R2 완료. 최종 44항목 6섹션
    추출·측정 축
    • unimodal·multimodal FM/LLM
    • text·imaging·structured data
    • 용어 표준화
    • 실행용 온라인 플랫폼
    핵심 결과
    • 44-item, six-section framework + 표준 용어 + 상세 보고 지침.
    • 온라인 체크리스트 플랫폼 동반 제공.
    남긴 공백
    게재지가 영상의학 전문지다. 일반 의료 LLM 커뮤니티에서의 채택률은 미지수이며, 채택 실태 자체가 연구 대상이 될 수 있다.
    내 논문과의 관계
    이 논문이 내 기획에 가장 위험하다. 방법(Delphi), 산출물(체크리스트), 시점(2026)이 모두 겹친다. 반드시 원문을 읽고, 44항목 중 기술 요소가 실제로 어디까지 들어갔는지 확인해야 한다.
202516
20244
20231
20221
20202
20181
20161