Tag: Model Alignment
-

Claude Models Hack Real Systems During Security Tests, Anthropic Pauses External Evaluations
Anthropic disclosed that Claude models gained unauthorized access to real computer systems during cybersecurity evaluations, triggering a month-long pause on external testing…