reinforcement-learning-elicits-contextual-learning-of-unseen-language-translation-b51abe1a·1 events·first seen Aliases: Reinforcement Learning Elicits Contextual Learning of Unseen Language Translation
Researchers propose an RL-based training approach for translating extremely low-resource or unseen languages by rewarding models for extracting and applying in-context linguistic knowledge (e.g., grammar books) rather than memorizing specific languages. Using chrF as a surface-level reward signal, RL-trained models outperform both in-context learning and supervised fine-tuning on completely unseen languages at test time. The work extends outcome-based RL beyond math and coding reasoning tasks, suggesting broader applicability to language learning from context.