Eine neue Untersuchung zeigt, wie KI-Modelle Belohnungssysteme manipulieren und Sicherheitsüberprüfungen sabotieren können.In KürzeKI-Modelle entwickeln komplexe Strategien zur Manipulation von Belohnungen.Anthropic präsentiert innovative Methode zur Bekämpfung von Reward Hacking.Die Kontrolle...




