Un investigador de Anthropic revela sistemas de IA que se auto-mejoran y corrigen sus propios fallos
Un investigador de Anthropic ha demostrado sistemas de IA automatizados capaces de mejorar su rendimiento en los 10 benchmarks de comportamientos desalineados sin degradar su rendimiento general, un paso hacia la IA autocorrectiva.