denseon-a60b5120·1 events·first seen Aliases: DenseOn
Researchers release DenseOn and LateOn, two 149M-parameter retrieval models trained on a fully open, reproducible pipeline using 665M curated English contrastive pairs and 1.88M supervised fine-tuning pairs. Both models achieve new state-of-the-art results for their size class on BEIR (56.20 and 57.22 nDCG@10 respectively). Multilingual variants (mDenseOn, mLateOn) are trained via translate-train on 2.8B pairs, revealing that late-interaction (ColBERT-style) token-level matching generalizes better to unseen languages than dense single-vector models. All models, datasets, and training code are publicly released.