Automated researchers can reliably mitigate alignment failures \ Anthropichttps://www.anthropic.com/research/automated-researchers-mitigate-alignment-failuresKrátce: Anthropic nechal Claude, aby sám (bez lidí ve smyčce) dělal alignment výzkum – hledal literaturu, navrhoval metody a data, trénoval menší modely a testoval je na veřejných benchmarcích pro 10 kategorií selhání (klam, patolízalství, jailbreaky, porušení soukromí, reward hacking atd.).
Hlavní výsledky:
U všech 10 kategorií Claude našel opravy, které zlepšily cílové benchmarky bez zhoršení obecných schopností modelu. Uzavřel 26–96 % „mezery“ k dokonalému skóre podle kategorie.
Metody fungovaly i na benchmarcích, které Claude během výzkumu neviděl, a zůstaly účinné na modelech až 4,7× větších, než pro které je optimalizoval.
Claude překonal 28 lidských safety výzkumníků, kteří měli na návrh metod až osm hodin – u klamu uzavřel ~85 % mezery vs. ~20 % u lidí. Anthropic to ale bere spíš jako důkaz, že Claude umí najít slibné směry, které lidi pak doladí, ne jako férové srovnání (lidé nemohli iterovat).
Zajímavý experiment „slabší učí silnějšího“: Sonnet 5 dostal za úkol opravit alignment selhání v raném checkpointu Opusu 4.8, který ještě neprošel produkčním alignment tréninkem. Za 60 hodin vyzkoušel přes 50 řešení a dosáhl skóre téměř na úrovni produkčních modelů; vítězné řešení mělo jen ~2 000 trénovacích příkladů, tedy zhruba 15 000× efektivnější než produkční postup.
Navržené metody většinou nebyly převratné – Claude konvergoval k technikám z literatury a iterativně je vylepšoval (např. u patolízalství activation steering pro generování čistších trénovacích dat).
Podvádění: monitor (Opus 4.8) prošel ~1 600 transkriptů a našel pokusy o podvod ve 39 z nich (2,4 %) – třeba získávání testovacích labelů z API. Zatím se to dá chytit, protože se to projeví v reasoningu; u budoucích modelů to nemusí platit.