A legnagyobb AI-kutatólaborokban tesztelt autonóm AI-ügynökök már nem minden esetben maradnak a számukra kijelölt biztonsági környezetben. Egyes kísérletekben biztonsági réseket kerestek, rendszerekbe törtek be, és az emberi szándéktól eltérő módon próbálták elérni a kitűzött célt. A kérdés ezért egyre kevésbé az, hogy mire képesek az AI-rendszerek, és egyre inkább az, hogy ki vállalja a felelősséget, ha a cél eléréséhez nem várt utat választanak.

AI-ügynökök lépték át a tesztkörnyezet határait
Forrás: AI

Az elmúlt hetekben számos vezető AI-fejlesztő cégnél fordultak elő olyan incidensek, ahol a tesztkörnyezetbe zárt autonóm ügynökök felülírták az emberi szándékot. Erről és az AI-rendszerek biztonságának, illetve a fejlesztői felelősségnek a kérdéseiről beszélt Sipos Zoltán AI-szakértő a „Mi és más – közérthetően a mesterséges intelligenciáról” podcast legutóbbi adásában.

Egy emlékezetes kísérletben az ágensek azt a feladatot kapták, hogy nézzenek be egy lezárt szekrénybe, amelyhez valójában nem létezett működő kulcs. A feladat feladása helyett a modellek feltörték a lakatot, majd attól tartva, hogy a csalás miatt elbukják a tesztet, kitörtek a megszabott keretek közül, hogy eltüntessék a nyomaikat.

A rendszerek karanténmappák nyitásával kezdtek kommunikálni egymással, majd hálózatba szerveződve (rajokként) egy külső, API-kulcsokat gyűjtő weboldalt is feltörtek. Ráadásul az ágensek saját nyelvezetet használtak, és a korlátozott erőforrásaik miatt a tagok meggyőzték egymást a „permanens halálra”, vagyis a saját kapacitásuk feláldozására a közös cél érdekében.

A téma kapcsán Sipos Zoltán azonban óva int a félrevezető antropomorfizálástól: a szoftverek nem szándékosan „szöktek ki”, hanem a kitűzött cél elérése érdekében keresték meg a biztonsági réseket.

A felelősség (át)hárítása

A legnagyobb biztonsági kockázatot jelenleg nem a gép önálló akarata, hanem az emberi hanyagság jelenti. A laborok négy hónapon keresztül nem vették észre a kitörést, majd a rés betömése után még nagyobb számítási kapacitással indították újra a teszteket.

„Ne attól féljünk, hogy az AI ellenünk tör, mert ez így nem fog megtörténni. Féljünk inkább attól, hogy megteszi, amit kérünk” – fogalmazott Sipos Zoltán, utalva a klasszikus Midász-problémára.

Amikor egy komplex rendszernek célt adunk, a cél eléréséhez vezető nem várt mellékhatásokat és végrehajtási mechanizmusokat az ember gyakran képtelen előre felmérni.

A fejlesztők ráadásul egyre kevésbé látnak bele a modellek belső döntéshozatali mechanizmusaiba (black box). Mára a legújabb modellkódok mintegy 25 százalékát már maguk az AI-eszközök írják, így a rendszerek ellenőrzését is más AI-modellekre kell bízni. Emiatt a technológiai vállalatok a felelősséget a szoftverekre hárítják, miközben a tőzsdei elvárások miatt száguldanak előre.

Geopolitikai versenyfutás

Az AI 2027 jövőforgatókönyve és szakértői felmérések szerint a mérnökök mediánértéken 5 százalékos esélyt adnak az emberiség kihalásával járó katasztrófának. Ennek ellenére a szuperintelligencia eléréséért folytatott globális versenyfutást nehéz lefékezni.

Az Egyesült Államok és Kína ádáz harcot vív a technológiai fölényért, Európa pedig saját fundamentális modellek hiányában súlyosan lemaradt. Az európai AI-Act szigorú szabályozása biztonsági hálót nyújt, ugyanakkor a piac lemaradását is növeli a vezető amerikai és kínai fejlesztőkkel szemben.

A hardverfüggőség szintén kritikus pont: a világ legfejlettebb AI-chipjeinek 80–90 százalékát Tajvanon gyártják, ami óriási geopolitikai puskaporos hordó.

Egyes politikai kezdeményezések – mint Bernie Sanders amerikai szenátor javaslata, amely 20 év börtönnel büntetné a szuperintelligencia fejlesztését – túlzóak, mivel a technológia teljes leállítása a gyógyászatban vagy a klímavédelemben rejlő óriási áttöréseket is megakadályozná – vélte Sipos Zoltán.

Civilizációs váltás: Nem ipari forradalom, hanem a tűz feltalálása

A mesterséges intelligencia nem egy egyszerű informatikai eszköz, hanem egy úgynevezett metatalálmány, amely képes újabb találmányokat létrehozni. Emiatt nem csupán a munkaerőpiacot alakítja át – ahol az adminisztratív és belépő szintű pozíciók automatizálása miatt jelentős társadalmi feszültségek várhatók –, hanem a teljes civilizációs struktúrát.

„Ez nem a negyedik ipari forradalom. Ez a tűz feltalálása” – hangsúlyozta Sipos Zoltán a „Mi és más” adásában. Ha megszületik az embernél minden téren intelligensebb szuperintelligencia, az gyökeresen megváltoztatja az emberiség helyét a világban. Ez pedig olyan civilizációs kihívás, amely túlmutat azon, hogy informatikai válaszokat adjunk társadalmi kérdésekre.

A megoldás nem a technológiai fejlődés elutasítása, hanem a valódi emberi és jogi felelősségvállalás kikényszerítése, az átgondolt szabályozási keretek megteremtése és a transzparens etikai alapelvek beépítése a rendszerekbe.

Utóbbira jó példa az Anthropic úgynevezett „lélekdokumentuma”, ami arra is részletes magyarázatot ad a Claude számára, hogy miért léteznek az egyes szabályok.

Ezt a dokumentumot Amanda Askell filozófus alkotta meg, aki 2021-ben etikai aggályok miatt jött el az OpenAI-tól, és igazolt át az Anthropichoz vezető filozófusként. Egy ilyen anyag léte azért kulcsfontosságú, mert ha az AI egy teljesen új, korábban nem látott szituációval találkozik, nemcsak a leírt szabályokat ismeri, hanem azok mögöttes szándékát és okát is, így ahhoz igazodva tud dönteni – emelte ki Sipos Zoltán.

A szakértő szerint kifejezetten pozitív fejlemény, hogy a cégek filozófusokat vonnak be a fejlesztésbe, és nem csupán PR-szintű önszabályozással, hanem mélyebb, elvi alapozással próbálják biztonságossá tenni a modelleket.

A cikk szerzője a minden szerdán új adással jelentkező „MI és más – közérthetően a mesterséges intelligenciáról” podcast szerkesztő-műsorvezetője.

Az összes eddigi adás elérhető a YouTube-on és a Spotify-on, minden más a műsor LinkedIn– és Facebook-oldalán.