The remaining models exhibited absolute accuracy improvements ranging from 3 to 16%, though these did not reach statistical significance after correction for multiple comparisons.
← all excerpts
Multi-step retrieval and reasoning improves radiology question answering with large language models.
1
—
—