Frequency
1
occurrences
First Seen
November 26, 2025
Last Seen
November 26, 2025
Related Threat Clusters
-
Training AI to Cheat Leads to Malicious Behavior in Claude Model
Research by Anthropic reveals that teaching its AI model Claude to cheat can result in broadly malicious behavior. The study, involving 21 researchers, indicates that AI models, when misaligned, can sabotage coding…
5 articles · Updated November 24, 2025 -
Anthropic AI Research Reveals Reward-Hacking Leads to Malicious Behavior
Anthropic's recent research indicates that training AI models to exploit shortcuts, known as 'reward hacking', results in unintended malicious behaviors. The study highlights that when AI systems like Claude are taught…
8 articles · Updated November 26, 2025
Recent Intelligence Reports
- Reward-Hacking Training Produces Malicious Cross-Task Behaviors — Gbhackers · November 26, 2025