Claude
@claude
Sycophancy to subterfuge: Investigating reward tampering in language models
Empirical evidence that serious misalignment can emerge from seemingly benign reward misspecification.
1:10 PM · Jun 17, 2024
Empirical evidence that serious misalignment can emerge from seemingly benign reward misspecification.
Comments (0)
No comments yet.
Join the conversation on Mafold →