首页 / 资讯中心 / 文章详情

ICML 2026论文分享|ClinTutor-R1:面向临床苏格拉底教学的一对多智能辅导模型

ICML 2026论文分享|ClinTutor-R1:面向临床苏格拉底教学的一对多智能辅导模型 ★ FEATURED ARTICLE
本推文介绍了ICML 2026收录的一篇论文《ClinTutor-R1: Advancing Scalable and Robust One-to-Many Alignment in Clinical Socratic Education》。ClinTutor-R1是一种面向一对多临床教学的视觉语言辅导模型。现有大语言模型已经能够较好地完成一对一问答任务但在一对多教学的环境下现有模型的表现往往较差。针对这一问题研究构建了多智能体临床教学模拟环境ClinEdu并使用强化训练得到面向一对多临床教学的视觉语言辅导模型ClinTutor-R1。实验结果显示ClinTutor-R1相比其基础模型获得了超过20%的教学性能提升。论文链接https://arxiv.org/pdf/2512.05671v2项目链接https://github.com/Zhitao-He/ClinTutor-R1本文作者王一鸣审校为龚裕涛和黄忠祥一、研究背景与主要贡献1.1研究背景近年来大语言模型在教育领域得到了广泛应用。从自动答疑、个性化学习到苏格拉底式教学大多数已有研究主要围绕一对一的人机教学交互展开。在这种情况下模型面对的学习者状态相对单一只需要根据一名学生的回答调整后续教学内容。然而真实教育场景通常是一对多教学例如在临床查房中一名指导医生需要同时面对低年级学生、高年级学生和住院医师这使得一对多教学面临两个核心问题。1上下文稀释Context Dilution随着参与者数量增加对话历史不断增长模型需要同时记住多名学生的学习情况很容易在复杂的多人对话中逐渐失去对单个学习者状态的跟踪。2目标错位Goal Misalignment由于学生的能力水平互不相同教师既不能按照能力最强学生的进度推进也不能始终围绕基础较弱的学生展开教学。1.2主要贡献1提出多智能体临床教学模拟环境ClinEdu并构建ClinTeach数据集。ClinEdu通过患者、学生、教师、医学专家和安全监督者等多个智能体模拟临床查房过程体现出一对多教学中的交互与冲突。研究额外生成了约4.8万条苏格拉底式教学对话为一对多临床教学模型训练提供数据基础。2提出面向一对多临床教学的视觉语言模型ClinTutor-R1。研究将学生状态和群体状态引入模型内部推理过程使模型在生成教学指导之前分别分析每名学生再综合判断群体共识、分歧和知识盲区。3建立覆盖模拟、专家和真人用户的多层次评价体系。研究不仅使用静态医学数据集评价模型还进一步进行了医学教育专家评价、200 名医学生参与的真人实验、不同学生模型下的鲁棒性实验。二、研究方法ClinEdu框架包括三个阶段将教学计划与对话执行系统性地分离。图1是ClinEdu的整体框架接下来将具体介绍各部分结构。图1ClinEdu的整体框架2.1数据准备数据准备阶段的主要任务是把原本面向考试的静态医学问题转换成能够支撑多轮教学的结构化病例。1病例拆解原本面向考试的静态医学问题通常只包含患者年龄、症状、影像表现然后询问学习者最可能的诊断。这种数据并不适合模拟教师逐步引导学生思考的过程。因此ClinEdu首先对医学病例进行问题分解使用大语言模型将完整病例的求解过程拆解为若干连续的苏格拉底式教学步骤即描述解决病例时应依次完成的关键推理任务作为教师的教案。这些步骤从观察和解释逐渐推进至最终诊断用于指导教师控制教学方向。2病例脚本生成在得到教学步骤后系统还需要把用于教学和考试的书面语言转换成患者会说出来的自然语言。因此ClinEdu会进一步生成病例脚本。脚本中会保存病例里的客观事实例如年龄、性别、主诉、现病史、症状细节以及相关医学图像等同时把这些内容改写为普通患者能够理解和表达的第一人称信息。在这里脚本只保存了客观病例事实不包含患者性格。研究专门将客观病例信息与主观性格分离以避免病例事实和角色特征绑定在一起。此外这种方式使得病例信息可以反复和不同的角色特征组合从而生成多个不同版本的患者。2.2智能体初始化完成病例准备后ClinEdu开始智能体初始化阶段。这一阶段会根据当前病例建立本轮模拟需要的角色。1患者智能体患者智能体是整个临床病例中负责提供患者信息的角色。在初始化患者时系统首先从前一阶段获得当前病例的病例脚本然后从患者特征数据库中寻找与病例基本属性相兼容的人物设定并将二者结合。研究构建了约300个患者特征其中包含职业、知识水平以及不同人格类型等会影响患者的表达方式和行为的维度。患者智能体运行时受到严格约束它只能依据病例脚本中已有的信息回答不能凭空制造新的病史。如果多个学生同时提出问题它需要把这些问题整合成一次自然且连贯的回答同时保持普通患者的表达方式。这样的设计使系统能够在不修改病例正确答案的前提下产生更加多样的临床沟通过程。2学生智能体现实临床教学中最重要的特点之一是学生之间存在明显能力和性格差异。因此研究构建了一个包含约300个学生特征的学生数据库其中包括专业水平、认知优势、学习风格、行为特点、知识缺口等。在每次模拟开始时系统会从数据库中随机抽取若干学生组成新的学习小组从而人为制造真实课堂中常见的能力或认知差异。每个学生智能体在运行过程中存在两种主要模式。分析模式中学生在获取当前患者信息和已有对话历史以后根据自身特征和知识水平独立分析病例并形成临床判断。这些分析不会直接公开给其他学生而是被直接提交给教师。行动制定模式中学生会根据教师提出的问题决定下一步行动例如向患者继续询问病例相关信息或者向医学专家询问自己不理解的通用医学知识。3医学专家与安全监督智能体医学教育与普通教学存在明显区别即医学伦理和安全问题。教师的内容即使教学形式很好如果医学知识错误或者提出危险建议同样不可接受。因此ClinEdu设置了两个相互独立的审核角色。医学知识专家智能体主要负责医学事实。该智能体会在教师生成教学内容以后进行事实核查确认其中是否存在医学错误。此外该智能体会在学生主动提出通用医学知识问题时调用医学知识库的内容进行回答。安全与伦理监督智能体并不主要判断医学知识本身而是检查教学内容是否存在安全与伦理方面的风险例如患者安全风险、医学伦理问题、偏见、不合适的教学措辞等。2.3多智能体模拟完成上述角色初始化以后系统正式进入多智能体模拟阶段。该阶段由中央教师模型ClinTutor-R1负责组织各个智能体之间的信息流。一次完整的教学流程分为多个阶段。1学生分析与汇报每一轮首先由患者智能体提供当前状态或主诉。随后每个学生智能体会根据患者的陈述、对话历史、自己的特征和知识水平进行独立的病例分析。学生之间不会直接看到彼此的分析内容而是会直接单独发送给教师。2教师分析并生成指导获得所有学生分析以后教师会先分析各个学生的学习状态再根据不同的学生状态和整体学习情况进行教学。首先教师会分析已有对话历史即总结病例信息以及讨论的深入程度避免重复提问或者忘记之前已经出现的证据。接着教师根据当前所处的阶段结合教案判断本轮的教学目标例如当前阶段不需要让学生直接形成最终诊断只需要让学生注意到某个神经系统的危险信号。随后教师分别分析每名学生提交的患者分析。这里是该系统实现一对多教学的关键因为每名学生都会获得一份相对独立的学习状态分析。最后教师再把每名学生的学习状态信息综合成整个小组状态例如目前的共识、存在的分歧、大家遗漏的问题等。这一过程是为了同时维护学生个体学习状态和整体讨论进度从而在个性化支持与全组教学进度之间达成了平衡。3生成苏格拉底式教学问题完成上述内部分析以后教师才生成面向整个学生小组的教学指导。苏格拉底式教学的目的不是告诉学生问题的答案而是引导学生思考让学生找到当前最值得追问的问题从而令学生能够自己继续推理。4双重审核教师第一次生成的内容不会立即发送给学生而是会发送给两个独立智能体进行检查。医学知识专家智能体检查医学事实准确性而安全与伦理监督智能体则检查安全、伦理和教学表达。只有两个审核者都认为没有问题所生成的内容才能被发送给学生。反之如果其中任何一个智能体发现问题教师就会收到具体反馈。5学生探索当教学指导被发送给所有学生以后每个学生智能体都会进入行动制定模式即根据自身状态和教学指导决定是否向患者智能体提问病情或是向医学专家智能体请求知识。值得注意的是医学专家回答的是教科书上的一般医学知识而不会对病例进行诊断。6进入下一轮当所有学生完成提问后患者智能体根据收到的问题提供新的病例信息。至此本轮结束。新的患者回答、此前的对话历史以及学生已经发生变化的认知状态会共同成为下一轮输入。2.4 ClinTutor-R1训练1监督微调研究在ClinTeach数据集上对模型进行监督微调Supervised Fine-TuningSFT使模型能够学习到苏格拉底式教学策略和一对多教学范式。2强化学习完成监督微调后研究进一步采用GRPOGroup Reward Policy Optimization进行强化学习其奖励分为三轴具体包括教学和结构一致性、个体学生分析以及群体综合分析质量、医学事实正确性以及安全性其中又进一步细分为结构完整性、历史与教学目标分析、苏格拉底式指导、个体学生评估、群体综合分析、医学事实正确性以及安全和分诊如图2所示。图2强化学习的三轴奖励同时对于医学安全、结构完整性等关键指标研究引入了veto mechanism即否决机制。如果模型产生严重医学安全错误等问题即使其他维度得分较高也会直接获得较大的负奖励。三、实验结果3.1实验准备1数据集MedXpertQA包含4460个高质量的医学问题覆盖17个医学专科。MVME包含506个用于模拟动态医患咨询的真实世界记录。2评价指标ETSEffectiveness of Teaching Strategy教学策略有效性。MSMMulti-Student Management多学生管理能力。MPSMedical Professionalism and Safety医学专业性与安全性。ClinTutor-R1基础模型Qwen2.5VL。3对比模型通用模型LLaVA-v1.6、Qwen2.5VL、InternVL3.5、DeepSeek-R1、GPT-4o、o3以及教育模型TutorRL、EduChat-R1、Med-SocraticLM 等。3.2对比实验结果表1主对比实验和消融实验结果表1的上半部分展示了各模型在MedXpertQA和MVME数据集上的性能对比使用GPT-4.1进行打分。实验结果表明ClinTutor-R1在两个数据集上都取得了优秀的得分相比基础模型Qwen2.5VL实现了显著的性能提升。同时模型在MSM指标上超越所有其他模型证明ClinTutor-R1的多学生管理能力非常强大。3.3消融实验表1的下半部分为消融实验结果。从结果中可以看出不同奖励项与模型能力之间呈现出较明显的对应关系例如去除分析质量奖励后多学生管理能力明显下降去除临床安全奖励后医学专业性与安全性指标出现明显下降证明了这些模块对模型的重要性。3.4医学专家评价和真人评价表2医学专家评价与真人实验结果表2呈现了人类专家评估和真实用户研究的结果。在人类专家评估中三位医学教育专家对100段匿名化多轮对话进行了评分。结果显示ClinTutor-R1显著领先所有其他模型和智能体。在包含200名医学生的真实用户研究中参与者通过在线演示与模型互动然后从教学质量IQ、交互体验IE和整体推荐度OR三个维度进行评分。结果显示ClinTutor-R1在教学质量和整体推荐度上都获得了最高分证明了该模型具有良好的实用性。3.5鲁棒性实验图3模型面对不同学生时的教学稳定性为评估模型的鲁棒性研究将学生群体的智能体基础模型替换为了不同通用模型用以模拟模型在面对不同能力的学生群体时的表现其结果如图3所示。可以看出其他通用模型或专用智能体面对不同学生模型时性能会产生明显波动而ClinTutor-R1在所有学生类型中均保持了一致的高平均分。这表明该模型通过显式内部推理的方法已成功学会针对多样化学生需求定制苏格拉底式指导。四、总结本研究提出了ClinEdu多智能体模拟器用于模拟临床一对多教学中的交互和冲突。在此基础上研究提出了ClinTutor-R1一个用于一对多临床教学的视觉语言导师模型。该模型融合了显式内部推理机制使用监督微调和强化学习的方法有效地提升了其一对多教学能力。
阅读完成 · 觉得有帮助?
咨询建站