Benchmarking reliability and calibration of LLMs for multi-cancer early detection test communication.
To assess the reliability and confidence calibration of Large Language Models (LLMs) when communicating multi-cancer early detection (MCED) test characteristics in an expert-informed clinical evaluation.
Author(s): Takabatake, Koki, Rosito, Maria Sol, Braun, Danielle, Marinac, Catherine, O'Donnell, Elizabeth, Parmigiani, Giovanni
DOI: 10.1093/jamiaopen/ooag093