How's it going? Reinforcement learning in language models recruits a functional welfare axis
By andyqhan
We covered this paper in Research earlier this week, Researchers from NYU (with David Chalmers and Pavel Izmailov) designed an affectively-neutral emoji maze RL environment to isolate 'pure reward' from semantic associations, finding that RL recruits a functional welfare-like axis (positive/negative valence) in language models. This probes whether reward signals create internal representations analogous to welfare states, relevant to emergent misalignment and AI moral patienthood debates.