Nature子刊 IF=15.1 | AI辅助ICD编码的真实世界部署与评估:基于大模型与临床文档标准化

发布时间:2026/8/25 14:25:19

Nature子刊 IF=15.1 | AI辅助ICD编码的真实世界部署与评估:基于大模型与临床文档标准化
引言国际疾病分类ICD编码是医院运营的基石但手动编码过程耗时费力且易出错已成为全球医疗机构的沉重负担。尽管人工智能AI技术为自动化编码带来了希望但现有模型往往难以适应真实世界中复杂多变的临床文档结构其实际工作流程中的性能和用户接受度更是鲜有验证。近日一项发表在《npj Digital Medicine》上的研究带来了突破。来自台湾多所大学和医院的研究团队开发并部署了一套模块化、基于临床实际的人工智能编码系统。该系统不仅通过创新的模型选择框架确定了高性能的基础大语言模型还利用HL7临床文档架构CDA标准化的章节信息进行训练并在为期13周的随机对照试验RCT中证明该AI辅助工作流能显著提升编码效率同时揭示了不同背景的编码专家对AI工具的接受度差异为AI在真实临床环境中的落地提供了关键证据。基本信息•文章标题Evaluating real-world deployment of an HL7-CDA-aligned LLM for ICD-10-CM coding•期刊npj Digital Medicine•影响因子15.1•发表时间2026年3月3日•研究单位台湾高雄医学大学及其附设医院联合岛内多所高校、研究院与医疗机构并协同越南高校组成的跨地域、跨学科医疗科研合作网络•论文地址https://doi.org/10.1038/s41746-026-02541-5研究内容与方法数据集构建与预处理数据来源选取两家合作医院的HL7-CDAR2标准格式匿名临床数据集包含5个与ICD编码高度相关的核心章节出院诊断DischgDiag、病史MedHist、手术记录OpNote、病理报告PathRep、治疗过程TreatCous数据清洗执行统一清洗流程包括重复记录移除、ICD标签一致性检查、文本标准化数据集划分采用多标签分层采样8:1:1策略在训练、验证、测试集中保留ICD-10标签的原始分布文本截断策略受模型2048-token输入限制依据编码专家推荐的章节优先级优先截断低优先级章节内容确保诊断关键信息被保留【模块化ICD-10-CM编码系统框架与传统流程对比】注图(a)展示本文提出的结构化工作流涵盖数据采集、冗余感知采样、LLM-as-judge评估、分段微调与临床部署图(b)展示传统非结构化开发流程缺乏原则性模型选择导致资源浪费与低效。冗余感知采样策略语义冗余识别使用预训练的all-MiniLM-L6-v2句子编码器将每条出院小结编码为语义向量构建FAISS索引实现近似最近邻搜索计算向量间L2距离作为语义相似度指标当两条记录的ICD-10-CM代码完全一致且语义相似度超过阈值τ\tauτ默认设为0.9时标记为语义冗余样本对冗余样本保留规则计算冗余样本对的困惑度PPL公式如下PPLe−1N∑i1Nlog⁡p(xi∣xi,θ) PPL e^{-\frac{1}{N}\sum_{i1}^N \log p(x_i | x_{i}, \theta)}PPLe−N1​∑i1N​logp(xi​∣xi​,θ)其中NNN为文本序列长度p(xi∣xi,θ)p(x_i | x_{i}, \theta)p(xi​∣xi​,θ)为基础模型在参数θ\thetaθ下对第iii个token的预测概率保留PPL差异≥5%的样本中PPL更高的样本若PPL差异5%保留长度更长的样本以保留更多上下文信息【冗余感知采样前后ICD-10-CM章节分布对比】注展示高雄医学大学医院训练集在冗余移除前后各ICD-10-CM章节的样本数量分布变化。预训练基础模型选择方法候选模型范围筛选5个参数规模≤70亿的Decoder-only LLM包括PubMedGPT-2、Llama2-7B、Mistral-7B instruct及其领域适配变体MedLlama2、BioMistral-7BLLM-as-judge pairwise评估针对训练集中Top50高频ICD-10-CM代码让候选模型生成对应的临床定义文本采用Atla Selene Mini作为自动化评判模型对每对候选模型的输出进行语义保真度与临床适用性比较无明确偏好的案例标记为平局Plackett-Luce模型全局偏好排序基于pairwise比较结果构建有向对比图节点代表候选模型有向边表示模型间的胜负关系无向边表示平局依据Luce选择公理通过迭代Luce谱排序算法估算模型的全局偏好权重计算每个模型的选择概率P(Mk)αk∑j1mαj P(M_k) \frac{\alpha_k}{\sum_{j1}^m \alpha_j}P(Mk​)∑j1m​αj​αk​​其中αk\alpha_kαk​为模型MkM_kMk​的偏好权重mmm为候选模型总数选择概率最高的模型作为下游微调的基础模型【基于LLM-as-judge的基础模型选择结果可视化】注(a)为模型间胜负关系混合有向图有向边表示模型偏好无向边表示平局(b)为胜率矩阵热力图展示候选模型相对各对手的胜率。分段指令调优方法分段指令模板设计采用HL7-CDAR2对齐的指令式模板每个临床章节以“###”章节名作为前缀内容填充对应临床文本缺失章节显式标记为“Nil”统一输入输出结构两类模型训练策略通用分段感知模型使用完整模板训练支持处理异质文档结构训练与推理阶段均对缺失章节标记“Nil”固定分段组合模型针对特定章节组合如仅DischgDiag、DischgDiagMedHist等训练仅处理与训练时结构匹配的输入微调目标采用监督参数级微调以自回归训练损失更新模型参数学习ICD-10-CM编码任务输出区分主诊断与其他诊断的结构化代码【基于HL7-CDAR2的ICD-10-CM编码指令调优模板】注展示包含各核心临床章节的指令调优模板花括号为章节内容占位符。人类在环的RCT研究设计方法研究对象招募认证编码专家CCSs作为研究参与者随机化与工作流分配采用每周轮换的随机调度方案将每个CCSs分配到4种工作流无AI辅助对照组、3种AI辅助工作流HAN、PubMedGPT-2、BioMistral所有参与者需轮换所有工作流数据采集方法自动记录从AI编码界面激活到任务完成点击保存按钮的编码时间随机触发5点Likert满意度调查调查与对应工作流关联采用匿名方式收集统计分析方法编码时间分析剔除上下2.5%的异常值采用Welch’s ANOVA与Games–Howell事后检验比较不同工作流的编码时间差异满意度分析采用多项逻辑回归分析模型类型与编码专家背景特征从业年限、认证等级、教育背景、世代 cohort对满意度的影响显著性阈值设为p0.05p0.05p0.05实验结果分析模块化ICD-10-CM编码系统开发流程本研究提出的用于开发ICD-10-CM编码系统的模块化框架强调一种基于数据驱动的原则性方法以替代传统的、依赖直觉的流程。其核心步骤包括数据采集、冗余感知采样、基于LLM-as-Judge的成对模型评估与Plackett-Luce排名、基于HL7-CDA章节的指令微调以及最终的临床部署。该流程旨在通过系统性的模型筛选和训练实现资源高效且可扩展的编码系统开发为后续的真实世界评估奠定了基础。基于内在语义评估的模型选择研究评估了五个参数量在70亿以下的解码器模型对ICD-10-CM代码定义的理解能力。BioMistral在与其他模型的成对比较中获得了最高的总体胜率。通过Plackett-Luce模型聚合所有比较结果后BioMistral获得了44.1%的选择概率被确定为最适合进行下游微调的基础模型。这一内在评估作为一种低成本的启发式方法有效缩小了候选模型范围其得出的排名与下游微调后的编码性能排名保持一致验证了该筛选策略的实用性。真实世界部署效果编码效率与用户满意度上图展示了在为期13周的人机协同随机对照试验中不同工作流程下的平均编码时间。结果验证了AI辅助工作流程能显著提升效率。与完全手动编码相比所有三种AI辅助工作流程HAN、PubMedGPT-2、BioMistral都显著减少了单份病历的编码时间。其中PubMedGPT-2带来的时间减少幅度最大其次是BioMistral和HAN。上图进一步分析了认证编码专家对不同AI模型及工作流程的满意度揭示了用户接受的异质性。在模型类型上技术性能更优的BioMistral获得了最高比例的正面满意度评价。用户满意度显著受到编码员背景特征的影响拥有医疗管理背景、高级认证、10-24年工作经验以及属于X世代的编码员满意度更高而具有医学相关学术背景、工作经验少于10年以及属于Y世代的编码员满意度相对较低。这表明AI在真实工作流程中的成功整合不仅取决于模型准确性还深刻依赖于工作流程适配性和个体用户的接受度。优势与局限优势•模块化与可扩展性强提出包含数据去冗余、基于LLM-as-judge的模型选择、HL7-CDA对齐的章节感知微调在内的完整、模块化流水线支持在异构文档环境中进行可扩展的ICD-10-CM编码。•真实世界验证充分通过为期13周、涉及10名认证编码专家的随机对照试验在真实临床工作流中验证了AI辅助编码能显著减少编码时间并系统评估了用户满意度与接受度。•模型选择方法高效结合成对LLM-as-judge评估与Plackett-Luce排序提供了一种资源高效的基础模型筛选启发式方法避免了对所有候选模型进行穷举微调。局限•模型选择依赖自动化评判基础模型筛选依赖于LLM-as-judge评判模型本身可能存在偏见且内在定义生成能力与下游编码性能的关联性仅在有限候选模型集中得到验证。•真实世界部署面临动态挑战研究因全国性ICD-10-CM版本更新而提前终止凸显了临床AI系统需适应不断演变的编码标准与政策这在受控基准研究中很少被考虑。•用户接受度存在异质性编码专家的满意度因经验、认证、代际 cohort 等因素存在显著差异表明成功的人机协同不仅取决于模型性能还需考虑角色敏感性的工作流设计。参考文献Dong, H., Suárez-Paniagua, V., Whiteley, W. Wu, H.Explainable automated coding of clinical notes usinghierarchical label-wise attention networks (HAN)and label embedding initialisation.Journal of biomedical informatics116, 103728 (2021). 该论文提出了用于临床笔记自动编码的分层标签注意力网络HAN是本研究用于对比的经典深度学习方法之一为评估大语言模型在ICD编码任务上的性能提供了重要基准。Ji, S., Hölttä, M. Marttinen, P.Does the magic of BERT apply to medical code assignment? A quantitative study.Computers in biology and medicine139, 104998 (2021). 本文系统评估了BERT等编码器模型在医疗编码任务上的表现指出了其在处理长文档和全编码集时的局限性为本研究选择解码器架构的大语言模型提供了关键背景和对比依据。Zheng, L. et al.Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in neural information processing systems36, 46595-46623 (2023). 该研究提出了LLM-as-a-Judge的评估框架为本研究采用成对LLM比较和Plackett-Luce模型进行基础模型筛选提供了核心方法论支持。Labrak, Y. et al.BioMistral: A Collection of Open-Source Pretrained Large Language Models for Medical Domains. In Proceedings of the62nd Annual Meeting of the Association for Computational Linguistics (ACL’24). 本文介绍了在生物医学领域预训练的大语言模型BioMistral该模型在本研究中被筛选为最优基础模型并在后续微调和真实世界部署中展现出最一致的性能。Venkatesh, K. P., Raza, M. M. Kvedar, J. C.Automating the overburdened clinical coding system: challenges and next steps.npj Digital Medicine6, 16 (2023). 该综述探讨了自动化临床编码系统面临的挑战与未来方向强调了模型准确性之外的工作流适配和用户接受度问题为本研究设计包含人机交互的随机对照试验和评估多层面采纳指标提供了理论框架。

相关新闻

全局快门 vs 滚动快门:工业读码器选型必看参数

全局快门 vs 滚动快门:工业读码器选型必看参数

2026/8/25 14:25:19

工业读码器的快门类型,指的是图像传感器曝光时的工作方式,主要分为全局快门(Global Shutter)和滚动快门(Rolling Shutter)两种。这个参数直接决定了读码器能不能拍清楚高速运动的条码,是工业读码…

Kimi    LeetCode LCP 27. 黑盒光线反射 Python3实现

Kimi LeetCode LCP 27. 黑盒光线反射 Python3实现

2026/8/25 14:25:19

这是 LeetCode LCP 27. 黑盒光线反射 的 Python3 实现。解题思路核心思想是预处理所有光线循环 有序集合维护:1. 状态定义:每个状态由 (小孔序号, 方向) 组成。方向 1 表示沿 yx,-1 表示沿 y-x。 2. 预处理循环:利用数学公式直接…

Linux学习21-hadoop续及hadoop高可用部署

Linux学习21-hadoop续及hadoop高可用部署

2026/8/25 14:25:19

yarn部署新增节点node4下载nfs执行yum install nfs-utils命令下载安装NFS相关工具包。node1做免密,与本机也做免密在node1上生成SSH密钥对,并将公钥分发到各节点,实现免密登录。将node1的公钥添加到本机authorized_keys中,实现本机…

Spring Boot + 微信小程序高校食堂自助点餐系统70381----从个性化推荐到订单运营的完整实现

Spring Boot + 微信小程序高校食堂自助点餐系统70381----从个性化推荐到订单运营的完整实现

2026/8/25 14:55:20

摘要该系统面向高校食堂高峰期排队时间长、点餐效率低以及运营数据分散等问题,采用“用户移动点餐 管理端运营”的双端模式。用户端围绕菜单推荐、菜品浏览、加购下单、订单管理、资讯与反馈形成连续体验;管理端负责销售统计、用户管理、内容维护、反馈…

[通信与计算]通信原理02:源编码与熵的考虑

[通信与计算]通信原理02:源编码与熵的考虑

2026/8/25 14:55:20

源编码与熵的考虑本文从通信与信息论角度,系统介绍源编码与熵相关的基本概念和工程实践。首先定义离散无记忆信源的熵,解释其作为理论最优平均码长下界的意义,随后讨论前缀码、哈夫曼编码、算术编码和Lempel-Ziv通用编码等典型方法&#xff0…

模型幻觉检测与抑制技术-金融医疗双案例实战

模型幻觉检测与抑制技术-金融医疗双案例实战

2026/8/25 14:55:20

模型幻觉的检测与抑制技术:金融客服与医疗转录双案例实战声明:本文案例为工程模拟场景,数据指标为演示效果,仅供工程思路参考,不代表真实业务结果。背景:幻觉是"检测"出来的,还是&quo…

Python办公11:定时自动同步重要文件夹至移动硬盘或云端

Python办公11:定时自动同步重要文件夹至移动硬盘或云端

2026/8/25 14:55:20

11:备份专家——定时自动同步重要文件夹至移动硬盘或云端第二阶段:文件管理与系统自动化(9-15)场景引入 你的工作资料只存在电脑本地?一旦硬盘损坏、电脑丢失或中勒索病毒,几年的心血瞬间归零。 专业的做法…

离职电脑隐私清理完整指南——临走前别忘把“自己“带走

离职电脑隐私清理完整指南——临走前别忘把“自己“带走

2026/8/25 14:55:20

背景:最近在试用期,想着万一下一步要走,公司电脑上的个人隐私得清理干净。微信聊天记录、浏览器密码、自己装的软件……哪些该删?怎么删才彻底?整理了一份超全的清理清单,按优先级和类别分好,离…

Windows系统文件WalletProxy.dll丢失找不到问题解决

Windows系统文件WalletProxy.dll丢失找不到问题解决

2026/8/25 14:45:20

在使用电脑系统时经常会出现丢失找不到某些文件的情况,由于很多常用软件都是采用 Microsoft Visual Studio 编写的,所以这类软件的运行需要依赖微软Visual C运行库,比如像 QQ、迅雷、Adobe 软件等等,如果没有安装VC运行库或者安装…

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

2026/8/24 19:53:32

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

2026/8/24 19:56:07

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

2026/8/24 21:16:09

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

三步把QQ空间历史说说导出到本地:GetQzonehistory 极简指南

三步把QQ空间历史说说导出到本地:GetQzonehistory 极简指南

2026/8/25 0:04:34

三步把QQ空间历史说说导出到本地:GetQzonehistory 极简指南 【免费下载链接】GetQzonehistory 获取QQ空间发布的历史说说 项目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistory Meta Description:GetQzonehistory 是一个QQ空间历史说…

洛谷 P7912:[CSP-J 2021 T4] 小熊的果篮 ← 双向链表

洛谷 P7912:[CSP-J 2021 T4] 小熊的果篮 ← 双向链表

2026/8/25 0:04:35

【题目来源】 https://www.luogu.com.cn/problem/P7912 【题目描述】 小熊的水果店里摆放着一排 n 个水果。每个水果只可能是苹果或桔子,从左到右依次用正整数 1,2,…,n 编号。连续排在一起的同一种水果称为一个“块”。小熊要把这一排水果挑到若干个果篮里&#x…

Transformers.js 网页端图像抠图实战:零后端 3 行代码返回透明 PNG

Transformers.js 网页端图像抠图实战:零后端 3 行代码返回透明 PNG

2026/8/25 0:04:35

Transformers.js 网页端图像抠图实战:零后端 3 行代码返回透明 PNG 【免费下载链接】transformers.js State-of-the-art Machine Learning for the web. Run 🤗 Transformers directly in your browser, with no need for a server! 项目地址: https:/…

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/22 2:02:26

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/22 4:13:47

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/22 1:32:34

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…