In contrast, prompting alone did not improve performance: The base GPT-5 model was modestly preferred over GPT-5_p, although this difference did not reach statistical significance (difference, 0.28; P = .08; 57% win rate).
← all excerpts
Configuring large language models to deliver patient-facing explanations of pathology reports.
1
0.0800
0.0800