marginally significantP =.02
Larger models displayed architectural divergence where qwen2.5:72b maintained cross-lingual consistency (82.6% vs 83.5%; OR 0.88, P =1.000), while Llama3.1:70b showed language-dependent performance (80.2% vs 90.1%; OR 0.29, P =.02, marginally significant).