研究具体检验了什么
2025 年 4 月发表的 AMIE 研究,在患者演员参与的文字问诊中比较诊断对话系统与初级保健医生。研究采用随机、双盲交叉设计,评价诊断和沟通等表现。
AMIE 在这一设置中取得了积极结果。作者也明确指出,同步文字聊天和模拟患者的研究条件,并不代表日常临床实践。评价成绩应当连同这些条件一起阅读。
使用场景决定验证问题
知识检索、文书整理、研究数据审阅与诊疗判断,使用的资料和输出承担的责任各不相同。将模型接入产品之前,应先确定使用者是谁、输出交给谁,以及它会影响哪一步工作。
我们的应用判断,是从范围明确的专业辅助任务开始。例如,检索结果关联原始段落,文书草稿保留引用和缺失信息,研究记录能够返回对应表单与版本。每一项设计都服务于具体的核查动作。
审核需要在界面中发生
要求专业人员复核,意味着系统需要提供足够的材料和操作入口。使用者应能查看原文、定位修改、指出错误,并知道哪些内容已经过确认。
评价这类工具时,我们会关注来源是否对应、关键信息是否遗漏,以及完成审核需要多少操作。模型生成得快,如果使用者仍要重新寻找全部资料,任务未必因此得到改善。
涉及临床判断的用途,还需要与其场景匹配的专业验证和审核。AMIE 的模拟研究为研究方向提供线索;我们自己的系统仍需为具体用途建立独立证据。



