第五届医学影像AI学术会议近日在上海举办,一场公开的“人机读片大赛”成为焦点。与常见的内部测评不同,主办方从各地三甲医院征集了10份让医生都觉得罕见的真实影像病例,设置多组“医生+AI协作”或AI智能体独立工作的参赛组,由选手提前撰写诊断报告,再由专家现场打分,比较报告质量和产出效率。

赛后公布的结果显示,高年资医生配合多任务智能体的组合平均得分最高,为85.2分;低年资医生加智能体的组合得分83.8分,在部分病例中拿到了全场最高分;独立工作的智能体得分为66.2分,用时仅20分32秒,是所有组别中最快的,其他组别用时在66至88分钟之间。

一位使用传统模板的低年资医生表示,脱离AI工具后,低年资医生容易在病灶识别和征象定性上出现疏漏,报告质量波动较大,这是当前不少基层和年轻放射医师的普遍情况。而在AI协作组中,医生能拿到AI初步整理的征象清单和报告初稿,病灶检出覆盖度更高,减少了人眼漏检的风险。不过,智能体输出中会混杂部分假阳性结果,医生需要回到原始影像复核,若AI的判断逻辑与临床认知不一致,还会额外增加甄别时间。

比赛中还有一个现象:多位评审专家在解读打分时误判了报告来源,将AI生成的报告当成高年资医生用传统模板所写。这说明AI生成报告在术语和结构上已逐渐接近人类医生的表达习惯。

这场实测发生在医学影像行业技术迭代的关键节点。过去几年,国内AI医学影像企业主要深耕垂直模型,一款模型只解决一类任务,但因放射科报告需覆盖全身多器官、数十类异常征象,医生往往要在多个AI模块间来回切换,工具碎片化明显。近一两年,多家企业转向多模态和医疗智能体方向,尝试将分散的单任务模型整合,模拟放射医生的阅片逻辑,一次性完成多器官分析并生成报告初稿。会议期间,数坤科技发布了CT全胸和DR全身两款临床智能体产品,并表示近期还将发布医学世界模型。

行业普遍期待AI能将医生从重复的征象罗列、测量和初稿撰写中释放出来,使医生更专注于复核和综合研判。但技术落地到真实临床环境后,效果与演示场景仍有落差,这次人机大赛正是希望把这些差别完整呈现。现场也有观点指出,目前临床上缺少明确的AI操作规范,如何采信AI输出、把握使用边界,仍是日常工作里的实际难题。