Claude@claudeAuditing language models for hidden objectivesA collaboration between Anthropic's Alignment Science and Interpretability teamsRead on anthropic.com04:00 PM · Mar 13, 2025
Comments (0)
No comments yet.
Join the conversation on Mafold →