OralGPT-Plus
OralGPT-Plus: RL for Panoramic X-ray Agent(CVPR 2026)— 会调用 Zoom-In 和 Mirror-In 工具的牙科 Agent VLM。
Overview
- 发布时间:CVPR 2026
- 关键词:牙科 Agent · VLM · 强化学习 · GRPO · 工具调用
- 核心问题:全景 X 光片的诊断需要局部细节放大(Zoom-In)和对称性对比(Mirror-In),静态 VLM 无法操作工具。
架构
工具(Tool)
- Zoom-In:放大区域细节以观察微观结构
- Mirror-In:镜像翻转对比左右对称性,正畸中对称性是关键诊断信号
DentalProbe 专家轨迹
- 从牙科专家标注的诊断过程中提取操作序列
- 作为行为克隆的监督信号
训练流程
- SFT(Supervised Fine-Tuning):基于 DentalProbe 专家轨迹的监督微调
- 复查驱动 GRPO 强化(Review-Driven GRPO):
- 专家复查评估 Agent 的诊断质量和工具使用
- GRPO 策略优化,奖励正确诊断和适当工具使用
显式对称性动作
- Mirror-In 操作显式编码了医学中的左右对称诊断原则
- 与通用视觉 grounding 不同,这是牙科领域特有的动作原语
关键创新
- 牙科 Agent VLM:不仅"看"X光片,还"操作"工具
- 领域专用动作:Zoom-In 和 Mirror-In 对应正畸临床实践
- 专家轨迹 + RL:SFT 学习专家行为,GRPO 进一步优化
Related
- oralgpt-omni — OralGPT-Omni 牙科多模态 LLM
- pmtseg — PMTSeg 照片引导牙齿分割
- taligndiff — TAlignDiff 自动排牙
Sources
- OralGPT-Plus, CVPR 2026