Anthropic has released a new paper demonstrating that AI systems can autonomously improve a model’s performance on alignment benchmarks, offering an early glimpse.