AI에게 약 같이 먹어도 되냐고 물어봤더니 — 비위험 81개 중 49개를 위험으로 봤다
약 두세 개를 같이 먹어도 되는지 AI에게 묻는 사람이 늘고 있습니다. 2026년 연구에서 ChatGPT-4는 항경련제 관련 중요한 약물상호작용의 87.6%를 찾아냈지만, 전문 데이터베이스 Lexicomp 기준으로 중요하지 않은 81개 조합 중 49개(약 60.5%)를 중요한 상호작용으로 잘못 분류했습니다. '위험을 놓치는 문제'뿐 아니라 '없는 위험을 만들어내는 문제'도 함께 봐야 합니다.
- 비교한 약물 조합: 186개 (항경련제 + 병용약)
- 본문 Table 3 기준 임상적으로 중요한 조합: 105개 / 중요하지 않은 조합: 81개
- ChatGPT-4가 중요한 상호작용을 찾아낸 비율(민감도): 87.6% (92/105)
- 중요하지 않은 81개 중 위험하다고 잘못 분류: 49개, 약 60.5% (DERIQO 계산: 49 ÷ 81)
- ChatGPT-4 특이도: 39.5% (32/81)
60.5%는 논문 본문 Table 3의 실제 건수(참음성 32, 거짓양성 49)를 이용해 DERIQO가 계산한 값이고, 민감도·특이도·건수는 연구가 보고한 값입니다.
중요한 상호작용은 비교적 잘 찾았다
2026년 Exploratory Research in Clinical and Social Pharmacy 연구는 항경련제와 다른 약의 조합 186개를 ChatGPT-4·DeepSeek-V3·Drugs.com에 질문하고, 전문 약물상호작용 데이터베이스 Lexicomp와 비교했습니다.
본문 Table 3 기준으로 Lexicomp는 이 가운데 105개를 임상적으로 중요한 상호작용, 81개를 경미하거나 상호작용이 없는 조합으로 분류했습니다. ChatGPT-4는 중요한 105개 가운데 92개를 찾아냈고(민감도 87.6%), 13개는 놓쳤습니다. 위험한 상호작용을 찾아내는 능력 자체는 이 연구에서 상당히 높았습니다.
문제는 '아닌 것'을 아니라고 하는 능력이었다
반대 방향에서는 결과가 크게 달랐습니다. 중요한 상호작용이 없는 81개 조합 가운데 ChatGPT-4가 제대로 제외한 것은 32개, 중요한 상호작용이 있다고 잘못 판단한 것은 49개였습니다.
| Lexicomp 기준 중요하지 않은 조합 | ChatGPT-4 결과 |
|---|---|
| 전체 | 81개 |
| 제대로 제외(참음성) | 32개 |
| 중요한 상호작용으로 잘못 분류(거짓양성) | 49개 |
| 잘못 분류 비율 (DERIQO 계산) | 약 60.5% |
논문의 특이도는 39.5%입니다. 특이도가 낮다는 것은 실제로 문제가 없는 조합을 AI가 위험하다고 과대평가한 일이 많았다는 뜻입니다. 연구진도 이런 과대분류가 불필요한 걱정, 경고 피로, 추가 모니터링이나 치료 변경으로 이어질 수 있다고 지적했습니다. 참고로 같은 시험에서 구조화된 약물정보 사이트 Drugs.com은 민감도 87.0%·특이도 62.9%로, 단일 프롬프트 AI보다 균형 잡힌 성능을 보였습니다.
AI가 위험하다고 하면 약을 끊어야 할까
그렇게 해석하면 안 됩니다. 이 연구가 보여준 문제는 AI가 위험을 놓치는 것뿐 아니라, 실제로 중요하지 않은 상호작용까지 위험하다고 판단할 수 있다는 것입니다.
따라서 AI가 "이 두 약은 함께 복용하면 위험할 수 있습니다"라고 답했다고 해서 처방받은 약을 임의로 중단하는 근거가 되지 않습니다. 반대로 "특별한 상호작용은 없습니다"라는 답도 전문 데이터베이스나 의료진 확인을 대신하지 못합니다.
질문을 다시 시키자 정확도가 좋아졌다 — 다만 조건이 있다
연구진은 처음에 거짓양성으로 분류된 사례를 대상으로 AI에게 다시 질문했습니다. 같은 질문을 반복한 것이 아니라, 임상자료·알려진 약물대사 경로·공신력 있는 약물정보에 근거한 상호작용만 제시하도록 단계적으로 제한했습니다. 그 결과 ChatGPT의 특이도는 0.39에서 0.77로 올라갔습니다.
다만 이 분석은 186개를 처음부터 다시 시험한 것이 아니라, 첫 검사에서 거짓양성이었던 사례만 골라 수행한 사후 분석입니다. "프롬프트만 잘 쓰면 실제 약물상호작용 정확도가 77%가 된다"고 해석하면 안 됩니다. 연구진도 구조화된 약물상호작용 데이터베이스가 현재로서는 1차 선별에 더 적합하다고 결론 냈습니다.
다른 연구에서도 같은 방향이 보인다
2025년에는 프랑스 국가 약물감시 데이터베이스의 실제 이상반응 사례를 이용한 별도 연구가 있었습니다. 약물상호작용이 실제 존재한 82건과 존재하지 않은 22건을 ChatGPT·Claude·Gemini에 제시했는데, ChatGPT는 상호작용이 존재한 사례를 99% 탐지했지만 상호작용이 없는 사례까지 포함해 평가한 특이도는 68%였습니다(Claude 64%, Gemini 36%).
두 연구는 데이터와 평가방법이 달라 87.6%와 99%를 직접 비교할 수는 없습니다. 하지만 공통된 방향은 같습니다. AI는 위험 후보를 넓게 찾아내는 데는 강하지만, 그 위험이 실제로 중요한지 걸러내는 단계에서는 한계가 나타났습니다.
한국에서는 직접 확인할 방법도 있다
건강보험심사평가원은 일반인이 이용할 수 있는 DUR 국민 체험관을 운영합니다. 현재 복용 중인 의약품을 입력하면 다음 안전정보를 직접 확인할 수 있습니다.
| 확인 항목 | 내용 |
|---|---|
| 병용금기 | 함께 사용하면 안 되는 조합 |
| 동일성분중복 | 같은 성분이 겹치는지 |
| 효능군중복 | 비슷한 효능 약이 겹치는지 |
| 연령금기·임부금기 | 연령·임신 관련 제한 |
| 용량주의·투여기간주의 | 용량·복용기간 문제 |
| 노인주의 | 고령자 주의 |
한 번에 최대 100개 의약품까지 조회할 수 있습니다. 다만 심평원도 경고가 표시됐다고 해서 반드시 잘못된 처방이라는 뜻은 아니라고 설명합니다. 의학적으로 적절한 이유가 있으면 금기·주의 정보가 있는 약도 처방될 수 있기 때문입니다.
DERIQO가 도출한 결론
약물상호작용 질문에서 AI를 가장 잘 활용하는 방식은 '최종 판정기'가 아니라 '위험 후보 탐색기'로 쓰는 것입니다. 현재 먹는 약을 AI에게 보여주고 가능한 상호작용이나 확인해야 할 항목을 정리하게 하는 것은 도움이 될 수 있습니다.
하지만 AI가 위험하다고 했을 때는 DUR 같은 구조화된 정보원이나 약사·의료진으로 다시 확인해야 하고, 안전하다고 했을 때도 중요한 처방약이라면 AI 답변만으로 병용 여부를 결정해서는 안 됩니다. 이번 연구에서 눈에 띄는 것은 "위험을 얼마나 잘 찾았나"보다 그 다음 단계입니다. ChatGPT-4는 중요한 상호작용의 87.6%를 찾아냈지만, 중요하지 않은 81개 조합 가운데 49개도 중요한 상호작용으로 분류했습니다.
즉 약에 관한 AI 답변에서 '경고가 있다'는 것과 '실제로 복용을 바꿔야 할 정도의 상호작용이 있다'는 것은 같은 말이 아닙니다. AI 의료상담을 작업별로 어디까지 맡겨도 되는지는 AI 의료상담, 어디까지 맡겨도 될까에서 함께 다룹니다.
계산·검증 기준
- 2026년 항경련제 약물상호작용 연구의 본문 Table 3을 우선 사용
- 이 논문은 초록과 본문에 수치 차이가 있음: 초록은 ChatGPT 민감도 0.842·특이도 0.358, 186개 중 126개를 major/moderate로 표현. 본문 Table 3은 참양성 92·거짓음성 13·참음성 32·거짓양성 49로, 임상적으로 중요한 조합 105개·중요하지 않은 조합 81개(합 186)를 기준으로 민감도 0.876·특이도 0.395
- DERIQO는 개별 건수가 공개돼 계산을 재현할 수 있는 본문 표를 기준으로 함
- 잘못 분류 비율 = 거짓양성 ÷ (참음성 + 거짓양성) = 49 ÷ 81 = 60.5% (= 1 − 특이도)
- 반복 프롬프트의 특이도 0.77은 첫 검사에서 거짓양성이던 사례만 대상으로 한 사후 분석 결과
- 프랑스 연구(Therapeutic Advances in Drug Safety, 2025): 상호작용 82건·음성대조 22건, ChatGPT 탐지 99%·특이도 0.68
- DUR 국민 체험관 기능·조회 상한(100개)은 건강보험심사평가원 페이지에서 확인
- 연구 대상은 항경련제 관련 조합이고 모델도 연구 당시의 ChatGPT-4이므로, 결과를 모든 AI 모델·모든 의약품에 그대로 적용할 수 없음
공식 원문 및 검증 자료
Exploratory Research in Clinical and Social Pharmacy — 항경련제 약물상호작용 비교 연구 (2026)
186개 약물조합, Lexicomp 비교, ChatGPT-4의 민감도 0.876·특이도 0.395와 거짓양성 49건, 거짓양성만 대상으로 한 반복 프롬프트에서 특이도 0.77, 결론(구조화된 DB가 1차 선별에 더 적합)을 확인했습니다.
PubMed — 동일 연구 서지정보
2026년 3월 25일 공개, 제1저자(Maazuddin Mohammed), DOI(10.1016/j.rcsop.2026.100733), 초록 수치를 확인했습니다.
Therapeutic Advances in Drug Safety — 실제 약물이상반응 사례에서 LLM 약물상호작용 탐지 (2025)
상호작용 82건·음성대조 22건에서 ChatGPT 탐지 99%·특이도 0.68, Claude 0.64, Gemini 0.36을 확인했습니다.
건강보험심사평가원 — DUR 국민 체험관
최대 100개 의약품 입력, 병용금기·동일성분중복·효능군중복·연령금기·임부금기·용량주의·투여기간주의·노인주의 항목, "금기·주의 정보가 있어도 적정 사유가 있으면 처방될 수 있다"는 안내를 확인했습니다.
마지막 검증: 2026-09-10