did not reach statistical significancep = 0.0328
Although differences in AUC between Swin-T and ResNet34, InceptionV3, and ResNet152 did not reach statistical significance, McNemar’s test indicated Swin-T produced significantly fewer classification errors compared to ResNet34 ( p = 0.0328) and InceptionV3 ( p = 0.0304), suggesting a consistent advantage in practical diagnostic performance ( Table 3 ).