병원 AI 코딩 도구가 입원비 청구를 늘렸나, 미국 블루크로스협회는 6억 5,300만 달러가 AI와 연결됐을 수 있다고 봤다
- BCBSA 백서에 따르면 복잡한 환자로 분류된 입원 청구의 비율은 2023년 초 약 37%에서 2025년 말 약 40%로 올랐고, 2023년 기준 비율이 이어졌을 때보다 분석 기간에 복잡 사례로 더 분류된 청구 5만 5,158건(누적)에 6억 5,300만 달러가 더 지급됐다.
- 대장 수술 청구를 들여다보면 복잡도 증가 상위 25% 병원은 빈혈 진단율이 13.7%로 다른 병원(9.9%)보다 높았지만, 빈혈 진단 환자의 수혈률은 16.9%로 오히려 낮았다(다른 병원 19.3%).
- 협회는 이런 어긋남을 근거로, 높은 빈혈 진단율이 AI 기반 코딩의 결과임을 시사한다고 주장했다. 반면 AHA는 앞서 7월 말 게시한 팩트시트에서 2019~2024년 병원 환자 구성 지수가 약 5% 오른 것을 들어 AI가 코딩 강도를 부당하게 올리지 않는다고 반박해 왔다.

블루크로스협회가 백서로 제시한 9억 4,200만 달러
미국 블루크로스블루실드협회(BCBSA)는 9월 24일 「병원 코딩 강도 분석: 대장 주요 수술」이라는 백서를 공개했다. 코딩 강도란 병원이 입원 청구에 진단 코드를 붙이면서 환자를 더 복잡하고 더 비싼 진료비 분류군(DRG)으로 올려 잡는 정도를 말한다. 협회는 가맹 보험사들의 비식별 청구 자료를 썼고, 이 보험사들이 미국인 세 명 가운데 한 명을 가입자로 두고 있다고 밝혔다. 분석 기간은 2023년 1분기부터 2025년 4분기까지다.
백서에 따르면 입원 청구 가운데 합병증·동반질환(CC)이나 주요 합병증·동반질환(MCC)이 붙어 복잡한 사례로 분류된 비율은 2023년 초 약 37%에서 2025년 말 약 40%로 올랐다. 2023년의 기준 비율이 그대로 이어졌다고 봤을 때보다 복잡 사례로 더 분류된 청구는 분석 기간 동안 모두 5만 5,158건이었고, 여기에 건당 평균 1만 1,800달러, 모두 6억 5,300만 달러가 더 지급됐다. 협회는 코딩 강도가 올라 블루크로스 쪽이 더 부담한 금액을 2년간 약 9억 4,200만 달러로 추산했고, 부수 진단이 붙어 분류군이 올라간 몫이 그중 70%를 차지한다고 설명했다.
협회는 보도자료에서 미국 병원 시스템의 60% 이상이 AI 코딩 도구를 도입했다고 밝혔다. 백서는 이번 증가가 진료 기록과 검사 자료를 훑어 코드로 올릴 수 있는 것을 찾아내는 AI 기반 청구 소프트웨어를 병원들이 들여온 시기와 겹친다고 적었다. 협회는 3월에도 협회 산하 분석 조직 블루헬스인텔리전스(BHI)의 분만 입원 청구 분석을 소개했는데, 분만 입원에서 급성 출혈후 빈혈 진단이 늘어난 데 걸맞은 치료(수혈)가 따르지 않았다는 결과였다.
백서가 대장 수술 청구에서 짚은 진단과 치료의 어긋남
백서가 자세히 살핀 것은 주로 대장암이나 게실 질환을 치료하는 대장 주요 수술(DRG 329~331)이다. 2023년부터 2025년까지 이 수술에서 가장 복잡한 MCC 청구의 비율은 20.2%에서 22.7%로 올랐고, 합병증이 없는 단순 청구는 36.6%에서 32.8%로 줄었다. 이 분류군 하나에서만 늘어난 청구액이 6,080만 달러였다. 분류를 끌어올린 부수 진단 가운데서는 상세불명 산증(E87.20), 저삼투압·저나트륨혈증(E87.1), 급성 출혈후 빈혈(D62)처럼 검사 수치 하나로 붙일 수 있는 진단이 빠르게 늘었고, 영양실조·복강 내 농양·장폐색 기록도 함께 늘었다.
협회가 근거로 삼은 것은 진단은 붙었는데 그 진단에 따르는 치료가 보이지 않는 청구, 곧 「임상적 불일치」다. 2025년 기준 복잡도 증가 상위 25% 병원이 대장 수술을 복잡 사례로 분류한 비율은 75.6%로 다른 병원(65.0%)보다 높았지만, 중환자실 이용률은 11.5%로 다른 병원(13.2%)보다 낮았다. 수혈률(3.6% 대 3.9%)과 재원일수 중앙값(둘 다 4.0일)은 비슷했고, 재수술률은 1.7%로 다른 병원(1.5%)보다 약간 높았다.
빈혈에서도 같은 양상이 나왔다. 상위 25% 병원의 빈혈 진단율은 13.7%로 다른 병원(9.9%)보다 38% 높았지만, 빈혈로 진단된 환자 가운데 수혈을 받은 비율은 16.9%로 다른 병원(19.3%)보다 낮았다. 협회는 AI가 정상 범위를 벗어난 검사 결과를 모두 표시하도록 설정될 수 있는데 의사들은 보통 가벼운 빈혈은 치료하지 않는다고 설명하고, 이 어긋남은 높은 빈혈 진단율이 AI 기반 코딩의 결과임을 시사한다고 해석했다.
백서의 근거와 병원계의 반론
백서는 대장 수술 분석이 AI 기반 청구·수납 관리(RCM) 기술의 「흔적」을 드러낸다고 했고, 진단과 치료가 어긋나는 양상을 두고는 코딩이 늘어난 것이 환자의 실제 중증도 변화가 아니라 기록 관행의 변화를 반영한다는 「가장 강력한 지표」라고 썼다. 협회의 루크 초커 수석부사장은 이 어긋남은 AI가 더 아픈 환자가 아니라 청구할 수 있는 질환을 더 찾아내고 있음을 시사한다고 말했다. 다만 백서는 병원을 복잡도 증가폭(상위 25%와 나머지)으로 나눠 비교했고 병원별 AI 도입 자료는 제시하지 않았으며, 결론에서는 AI 기반 RCM 도구의 사용이 6억 5천만 달러 이상의 초과 지급과 「연결됐을 수 있다」고 적었다.
협회가 쓴 것은 가맹 보험사(BCBS 회사들)의 비식별 청구 자료였다. 메디컬데일리는 이 분석이 동료 심사를 거친 연구가 아니라 백서로 공개됐고, 진료 기록이 아니라 청구 자료에 기댄 것이라고 짚었다. 같은 보도에 따르면 협회는 환자가 실제로 더 아팠는지를 가리는 데는 진료 기록이 더 직접적인 검증 방법이라고 인정했고, 보도는 협회와 병원계 어느 쪽도 환자 단위의 진료 기록 검토는 내놓지 않았다고 전했다.
미국병원협회(AHA)는 이번 백서에 앞서 7월 말 게시한 팩트시트(8월 27일 AHA 뉴스로 소개)에서 AI가 코딩 강도를 부당하게 끌어올렸다는 보험사의 주장을 반박해 왔다. AHA는 2019년부터 2024년까지 병원의 환자 구성 지수(case-mix index)가 약 5% 올랐고 같은 기간 병원 비용 증가분의 19%가 더 아프고 복잡한 환자를 돌보는 데서 나왔다고 밝혔다. 가벼운 진료가 외래로 옮겨 가면서 입원 병상은 더 중한 환자로 채워지고 있고, AI는 기존 코딩 지침 안에서 정확한 기록을 돕는 도구이며 사람의 검증이 여전히 필요하다는 것이 AHA의 입장이다. AHA는 또 메디케어 지불자문위원회(MedPAC)가 2025년에 보험사가 운영하는 메디케어 어드밴티지 플랜 쪽의 과잉 코딩을 400억 달러 과다 지급의 한 요인으로 보고한 점을 들었다. AHA는 이 팩트시트에서 보험사들이 과잉 코딩을 구실로 병원 지급액을 일괄 깎지 못하게 해 달라고 행정부와 의회에 요구하기도 했다.
국내에서는 심평원이 AI 판독을 실제 심사에 쓰기 시작했다
국내에서는 청구를 심사하는 쪽이 AI를 실제 업무에 들이기 시작했다. 건강보험심사평가원은 9월 1일, AI 의료영상 판독 결과를 무릎관절의 퇴행성관절염 분야부터 실제 진료비 심사에 적용한다고 밝혔다. 심평원은 2018년부터 딥러닝 기반 판독 시스템을 개발해 왔고, 그동안 척추·무릎관절·요로결석 영상의 판독 결과를 참고 자료로만 쓰다가 이번에 무릎관절부터 실제 심사에 넣었다.
심사 담당자가 AI 판독 결과를 기존 심사 자료와 함께 확인해 심사에 활용하고, 전문적·의학적 판단이 필요하면 심사위원이 검토한다. 심평원은 사람이 최종 결정한다는 원칙과 적용 범위를 담은 내부 운영·윤리 기준을 먼저 마련했고, 무릎관절에서 결과와 정확도를 지켜본 뒤 척추와 요로결석으로 넓혀 갈 계획이다.
시사점
이번 논쟁은 의료 AI의 효과를 진단 정확도나 업무 시간으로만 따져서는 부족하다는 점을 보여 준다고 본다. 같은 도구가 의사에게는 빠뜨린 기록을 채워 주는 수단이고, 병원에는 수입을 늘리는 수단으로 보일 수 있으며, 보험사는 이를 비용 증가의 원인으로 지목한다. 백서는 「진단은 늘었는데 치료는 늘지 않았다」는 청구 자료의 어긋남을 근거로 내밀고 병원 쪽은 환자가 실제로 더 아파졌다고 말하는 만큼, 이 다툼은 진료 기록을 놓고 독립적으로 검증해 보기 전에는 어느 쪽으로도 결론이 나기 어려워 보인다.
국내에서도 심사하는 쪽에 AI가 들어온 만큼, 진료 기록과 청구를 만드는 쪽에 AI가 퍼지면 비슷한 질문이 나올 수 있다. AI가 기록에 붙인 진단이 실제 진료와 맞는지를 누가 어떻게 확인할지는 도입 초기에 정해 둘 만한 문제라고 본다. 심평원이 최종 결정은 사람이 한다는 원칙을 먼저 기준으로 세운 것처럼, 기록을 만드는 쪽의 AI에도 비슷한 기준이 필요할 것이다.
핵심 숫자
| 코딩 강도 상승으로 늘어난 비용 추산 (BCBSA, 2년) | 약 9억 4,200만 달러 |
|---|---|
| 복잡 사례 입원 청구 비율 (2023년 초 → 2025년 말) | 약 37% → 약 40% |
| 2023년 기준 비율보다 더 분류된 복잡 사례 (분석 기간 누적) | 5만 5,158건 |
| 추가 복잡 사례에 더 지급된 금액 | 6억 5,300만 달러 (건당 평균 1만 1,800달러) |
| 대장 주요 수술 MCC 청구 비율 (2023 → 2025) | 20.2% → 22.7% |
| 빈혈 진단율 (상위 25% 병원 대 다른 병원, 2025) | 13.7% 대 9.9% |
| 빈혈 진단 환자 수혈률 (상위 25% 병원 대 다른 병원, 2025) | 16.9% 대 19.3% |
| 병원 환자 구성 지수 상승 (AHA, 2019~2024) | 약 5% |
함께 읽을 것
출처
- Blue Cross Blue Shield Association · Hospital Coding Intensity Analysis: Major Bowel Procedures (백서) · 2026-09-24
- Blue Cross Blue Shield Association · Analysis examines AI in hospital billing as spike in complex patients adds nearly $1 billion in extra costs · 2026-09-24
- Blue Cross Blue Shield Association · Study suggests AI is boosting hospital billing · 2026-03-02
- American Hospital Association · Fact Sheet: Artificial Intelligence and Coding Intensity · 2026-07-31
- AHA News · Fact sheet details why use of AI alleviates burden for providers and does not improperly increase coding intensity · 2026-08-27
- Medical Daily · Blue Cross Ties $942 Million in Added Hospital Costs to AI Coding, but Hospitals Say Patients Are Sicker · 2026-09-25
- PYMNTS (로이터 인용) · AI-Generated Medical Coding Adds Nearly $1 Billion to Blue Cross Costs · 2026-09-24
- 아시아경제 · 심평원, AI 의료영상 판독 결과 진료비 심사에 첫 적용 · 2026-09-01