Chaoyi Wu and colleagues · npj Digital Medicine
Towards evaluating and building versatile large language models for medicine ↗
Final journal version: benchmark composition, evaluation settings, task-specific metrics and results.
Version: Published 2025-01-27
Evidence locator: Figure 1; Results; Tables 6–7
www.nature.com