Home
·
Blog
·
Work
·
About
Work
Giving a base model domain reasoning capabilities
— Take a base model and improve its reasoning on a specific domain via RLHF/RLVR.