approaching significancep = 0.057
All contextualized models show statistically significant improvement on Word2Vec (in all cases, p < 0.0005); and very similar results emerge regarding TransE, since the difference in scores is statistically significant for all models (BERT base: p = 0.0021, BERT large: p = 0.0004, LUKE base: p = 0.0054, LUKE large: p = 0.0085) but ELMO, which is approaching significance ( p = 0.057).