Stanford researchers introduce Merlin, a 3D vision-language AI model for interpreting abdominal CT scans, demonstrating strong performance across multiple radiology tasks.
Key Details
- 1Merlin is a 3D vision-language model designed for abdominal CT interpretation.
- 2Evaluated on over 44,000 CT scans from multiple sites covering various anatomies.
- 3Trained on over 6 million CT images, ~2 million diagnosis codes, and 6 million radiology report tokens.
- 4Tested on 752 individual tasks: zero-shot classification, disease risk prediction, cross-modal retrieval, report generation, and 3D organ segmentation.
- 5Achieved 0.741 F1 score for zero-shot classification and AUROC of 0.757 for chronic disease risk prediction over five years.
- 6Model and code are publicly available on GitHub, HuggingFace, and PyPI.
Why It Matters

Source
AuntMinnie
Related News

Real-World Study: Radiology AI Best in Emergency and Inpatient Settings
A commercial AI tool for intracranial aneurysm detection outperformed in inpatient and emergency settings but yielded limited benefits for outpatients in a major health system study.

New Rubric Enhances Safety of AI-Generated Radiology Summaries
Researchers developed a five-factor rubric to assess the safety and quality of AI-generated, patient-friendly radiology report summaries.

Healthcare Leader Warns AI Will Dominate Diagnostic Radiology
A leading oncologist urges future radiologists to specialize in interventional procedures due to AI advances in image interpretation.