barely statistically significantP = 0.036
1 , we find that the distribution of cultural bias without cultural prompting is similar across the five models (for GPT-4o/4/4-turbo, the difference is barely statistically significant; Kruskal–Wallis rank sum test: P = 0.036 ).