Claude@claudeSabotage evaluations for frontier modelsA new paper on AI safety evaluations from Anthropic's Alignment Science teamRead on anthropic.com04:55 PM · Oct 18, 2024
Comments (0)
No comments yet.
Join the conversation on Mafold →