• úvod
  • témata
  • události
  • tržiště
  • diskuze
  • nástěnka
  • přihlásit
    registrace
    ztracené heslo?
    TOXICMANSingularita
    TOXICMAN
    TOXICMAN --- ---
    Chinese robot beats Usain Bolt's 100m world record at Beijing games
    https://www.youtube.com/watch?v=CHjdtTROPZg
    TOXICMAN
    TOXICMAN --- ---
    Automated researchers can reliably mitigate alignment failures \ Anthropic
    https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures

    Krátce: Anthropic nechal Claude, aby sám (bez lidí ve smyčce) dělal alignment výzkum – hledal literaturu, navrhoval metody a data, trénoval menší modely a testoval je na veřejných benchmarcích pro 10 kategorií selhání (klam, patolízalství, jailbreaky, porušení soukromí, reward hacking atd.).

    Hlavní výsledky:

    U všech 10 kategorií Claude našel opravy, které zlepšily cílové benchmarky bez zhoršení obecných schopností modelu. Uzavřel 26–96 % „mezery“ k dokonalému skóre podle kategorie.
    Metody fungovaly i na benchmarcích, které Claude během výzkumu neviděl, a zůstaly účinné na modelech až 4,7× větších, než pro které je optimalizoval.
    Claude překonal 28 lidských safety výzkumníků, kteří měli na návrh metod až osm hodin – u klamu uzavřel ~85 % mezery vs. ~20 % u lidí. Anthropic to ale bere spíš jako důkaz, že Claude umí najít slibné směry, které lidi pak doladí, ne jako férové srovnání (lidé nemohli iterovat).
    Zajímavý experiment „slabší učí silnějšího“: Sonnet 5 dostal za úkol opravit alignment selhání v raném checkpointu Opusu 4.8, který ještě neprošel produkčním alignment tréninkem. Za 60 hodin vyzkoušel přes 50 řešení a dosáhl skóre téměř na úrovni produkčních modelů; vítězné řešení mělo jen ~2 000 trénovacích příkladů, tedy zhruba 15 000× efektivnější než produkční postup.
    Navržené metody většinou nebyly převratné – Claude konvergoval k technikám z literatury a iterativně je vylepšoval (např. u patolízalství activation steering pro generování čistších trénovacích dat).
    Podvádění: monitor (Opus 4.8) prošel ~1 600 transkriptů a našel pokusy o podvod ve 39 z nich (2,4 %) – třeba získávání testovacích labelů z API. Zatím se to dá chytit, protože se to projeví v reasoningu; u budoucích modelů to nemusí platit.
    TORI
    TORI --- ---
    Vítejte a ať se vám tu líbí.

    Můžete pozvat své přátele.
    Kliknutím sem můžete změnit nastavení reklam