M2RL
Collection
The SFT+RL+OPD model weights of paper "To mix or to merge: Toward multi-domain reinforcement learning for large language models" β’ 8 items β’ Updated β’ 1
YAML Metadata Warning:empty or missing yaml metadata in repo card
Check out the documentation for more information.
Haoqing Wangβ , Xiang Longβ , Ziheng Liβ , Yilong Xu, Tingguang Li, Yehui Tangβ
Samsung Research, Beijing, China Β· Peking University
If you find this work useful, please consider citing:
@inproceedings{
wang2026to,
title={To Mix or To Merge: Toward Multi-Domain Reinforcement Learning for Large Language Models},
author={Haoqing Wang and Xiang Long and Ziheng Li and Yilong Xu and Tingguang Li and Yehui Tang},
booktitle={Third Conference on Language Modeling},
year={2026},
url={https://openreview.net/forum?id=jP7j5XkG8J}
}