当前路径:/wiki/page/oralgpt-plus
返回首页索引

OralGPT-Plus

OralGPT-Plus: RL for Panoramic X-ray Agent(CVPR 2026)— 会调用 Zoom-In 和 Mirror-In 工具的牙科 Agent VLM。

Overview

  • 发布时间:CVPR 2026
  • 关键词:牙科 Agent · VLM · 强化学习 · GRPO · 工具调用
  • 核心问题:全景 X 光片的诊断需要局部细节放大(Zoom-In)和对称性对比(Mirror-In),静态 VLM 无法操作工具。

架构

工具(Tool)

  • Zoom-In:放大区域细节以观察微观结构
  • Mirror-In:镜像翻转对比左右对称性,正畸中对称性是关键诊断信号

DentalProbe 专家轨迹

  • 从牙科专家标注的诊断过程中提取操作序列
  • 作为行为克隆的监督信号

训练流程

  1. SFT(Supervised Fine-Tuning):基于 DentalProbe 专家轨迹的监督微调
  2. 复查驱动 GRPO 强化(Review-Driven GRPO)
    - 专家复查评估 Agent 的诊断质量和工具使用
    - GRPO 策略优化,奖励正确诊断和适当工具使用

显式对称性动作

  • Mirror-In 操作显式编码了医学中的左右对称诊断原则
  • 与通用视觉 grounding 不同,这是牙科领域特有的动作原语

关键创新

  1. 牙科 Agent VLM:不仅"看"X光片,还"操作"工具
  2. 领域专用动作:Zoom-In 和 Mirror-In 对应正畸临床实践
  3. 专家轨迹 + RL:SFT 学习专家行为,GRPO 进一步优化

Sources

  • OralGPT-Plus, CVPR 2026