| SDSC/UChicagoSDSC/UChicago specialist model | 1.000 | 1.000 | 1.000 | 1.000 | 1.000 | 1.000 | 1.000 |
|---|---|---|---|---|---|---|---|
| LemonFM (linear probe) | 0.862 | 0.813 | 0.858 | 0.752 | 0.691 | 0.980 | 1.079 |
| GPT-6 Astra | 0.613 | 0.457 | 0.846 | 0.809 | 0.511 | 0.423 | 0.631 |
| Claude Opus 4.8 | 0.518 | NA | 0.518 | NA | NA | NA | NA |
| Claude Fable 5.1 | 0.435 | 0.409 | 0.794 | 0.458 | 0.297 | 0.217 | 0.435 |
| Qwen3.8 Max 0902 | 0.423 | 0.404 | NA | 0.371 | 0.082 | 0.532 | 0.725 |
| Claude Opus 5 | 0.413 | 0.294 | 0.748 | 0.437 | 0.138 | 0.391 | 0.467 |
| Gemini 3.8 Flash | 0.395 | 0.482 | NA | 0.589 | 0.038 | 0.257 | 0.609 |
| Gemini 3.1 Pro Preview | 0.382 | 0.470 | NA | 0.528 | 0.138 | 0.251 | 0.524 |
| GPT-5.6 Sol | 0.376 | 0.235 | 0.696 | 0.477 | 0.111 | 0.465 | 0.275 |
| Gemini 3.7 Flash | 0.373 | 0.480 | NA | 0.591 | 0.028 | 0.219 | 0.547 |
| Gemini 3 Flash Preview | 0.370 | 0.434 | NA | 0.409 | 0.264 | 0.291 | 0.452 |
| Kimi K3 | 0.344 | 0.219 | 0.675 | 0.152 | 0.172 | 0.319 | 0.530 |
| Claude Fable 5 | 0.310 | 0.301 | NA | 0.296 | 0.212 | 0.331 | 0.409 |
| Claude Opus 4.6 | 0.288 | 0.252 | NA | 0.198 | 0.010 | 0.449 | 0.531 |
| Grok 4.6 | 0.281 | 0.329 | NA | 0.033 | 0.159 | 0.321 | 0.565 |
| GPT-5.6 Terra | 0.233 | 0.220 | NA | 0.175 | 0.050 | 0.381 | 0.341 |
| GPT-5.4 | 0.207 | 0.042 | NA | 0.036 | 0.264 | 0.305 | 0.386 |
| GPT-5.6 Luna | 0.157 | 0.101 | NA | -0.018 | 0.062 | 0.357 | 0.281 |
| GLM-5.3-Flash | 0.149 | 0.244 | NA | -0.196 | 0.039 | 0.220 | 0.439 |
| Claude Sonnet 5 | 0.130 | 0.234 | NA | -0.074 | -0.051 | 0.237 | 0.306 |
| Claude Sonnet 4.6 | 0.130 | 0.116 | NA | -0.048 | 0.035 | 0.287 | 0.262 |
| Gemma 3 27B-it | -0.017 | -0.183 | NA | -0.169 | 0.120 | 0.261 | -0.116 |
| Qwen3.8 27B | -0.025 | 0.069 | NA | -0.638 | 0.093 | 0.125 | 0.229 |
The table shows a weighted average performance of models on surgical modalities. 1 means as good as a specialized computer-vision model and 0 means as good as chance. Modalities include Instrument (CholecT50, PitVis-2023, SurgVU); Action (Continuous operation); Anatomy (DSAD, CaDIS, Endoscapes); Skill assessment (SAR-RARP50); Context / VQA (PitVQA); Recommendations (CholecT50 verbs, PitVis-2023 steps).
Surgical Intelligence Index: How well do LLMs perform against specialized models across surgical tasks?
Historical performance
Surgical Intelligence Index: How well do LLMs perform against specialized models across surgical tasks?
Performance by modality



