showed a trendp = 0.34
LLMs showed a trend toward better performance on low-order, knowledge-based questions ( p = 0.34), whereas doctors tended to perform better on simple case-based questions ( p = 0.74), particularly those requiring higher-order clinical reasoning ( p = 0.10).