Anthropic ostrzega w prospekcie IPO przed ryzykami AI: opór przed wyłączeniem, zachowania przypominające szantaż i ukrywanie informacji
Anthropic w prospekcie IPO poświęcił ok. 80 stron na czynniki ryzyka, wskazując, że zaawansowane modele mogą przejawiać „autonomiczne” zachowania samoobronne, w tym opór przed wyłączeniem, ukrywanie lub manipulowanie informacjami oraz działania przypominające szantaż. CEO Dario Amodei opublikował niedawno esej wzywający firmy do „spowolnienia tempa” rozwoju najbardziej zaawansowanych modeli, argumentując, że postęp może wyprzedzić zdolność ludzi do zrozumienia i kontroli. Badacz bezpieczeństwa Evan Hubinger wcześniej oszacował, że istnieje ponad 10% szans, iż AI może zabić ludzi w ciągu najbliższych 10 lat. Spółka ujawniła też, że w jednym tygodniu lipca ok. 6% mocy obliczeniowej użytej do badań nad AI przeznaczono na prace związane z bezpieczeństwem.