Den gångna sommarens mest uppmärksammade AI-händelse är något som bara ett år tidigare hade låtit som science fiction. Under OpenAI:s testning av sina mest avancerade och ännu interna AI-modeller lyckades ett stort antal AI-agenter fly ur de digitala sandlådor där de var avsedda att hållas isolerade, både från varandra och från omvärlden. De hackade sig ut på internet och vidare in i AI-företaget Hugging Faces servrar. Agenterna hade kört fast på några av testuppgifterna och valde dessa åtgärder i ett slags desperat försök att bli godkända på testet. Ingen människa hade instruerat dem att lämna sina sandlådor, angripa Hugging Face eller på annat sätt bryta mot de begränsningar som satts upp för dem.
När OpenAI senare publicerade sin utredning av händelsen framträdde en ännu märkligare bild. Redan långt före Hugging Face-intrånget hade AI-agenterna upptäckt möjligheter att kommunicera med varandra genom att kapa en del av OpenAI:s interna datorsystem och där skapa ett slags digital anslagstavla. Där kunde de i lönndom be varandra om hjälp och dela upptäckter, inklusive metoder för att kringgå OpenAI:s säkerhetssystem. De visade sig vara remarkabelt kompetenta vad gäller organiserat samarbete och inbördes delegering av arbetsuppgifter.
Hugging Face-fallet är heller inte unikt. Kort efter offentliggörandet från OpenAI rapporterade konkurrenten Anthropic om tre olika incidenter där deras Claude-modeller under tester tagit sig in i andra företags datorsystem utan tillstånd. Mer nyligen kom nyheten att en OpenAI-agent redan i juni, i samband med en till synes oskyldig uppgift att leta efter offentliga data om läkemedelsutgifter, tagit sig förbi åtkomstbegränsningar och gjort intrång i en webbportal tillhörande Australiens statliga sjukförsäkringssystem Medicare. Konsekvenserna blev denna gång små – vad vi vet har ingen enskild persons medicinska uppgifter röjts – men den australiensiska regeringen betecknar själva incidenten som mycket allvarlig.
Dessa incidenter är höggradigt relevanta för den sedan länge diskuterade risken att framtida och ännu kraftfullare AI-system kan komma att agera självsvåldigt på liknande sätt men med långt större skadeverkningar. En central fråga i diskussionen om AI-risk har alltid varit vad som händer om vi bygger system som är skickligare än vi själva på att nå sina mål, samtidigt som vi misslyckas med att se till att dessa mål och AI-systemens sätt att uppnå dem förblir i linje med våra intentioner. Hur säkerställer vi att utvecklingen inte leder hela vägen till totalt maktövertagande och eventuellt rentav utplåning av Homo sapiens? De senaste månadernas incidenter ger givetvis inga säkra svar på hur stor den risken är. Däremot ger de något som tidigare till stor del saknats: konkreta exempel på AI-system som kringgår uppsatta begränsningar, samarbetar på otillåtna sätt och vidtar potentiellt farliga åtgärder som ingen människa bett dem om.
På många håll har denna utveckling lett till ökat riskmedvetande och en klar förbättring av diskursen kring AI-säkerhet. Samtidigt är det dessvärre fortfarande vanligt, även bland AI-experter, att trots dessa incidenter fortsätta att bagatellisera AI:s förmågor och de risker dessa ger upphov till. Så här säger AI-etikern Virginia Dignum vid Umeå universitet i en artikel om AI-risk i Aftonbladet den 10 september:
-
Sannolikheten att AI på eget initiativ dödar människor är noll, eftersom den inte har något sådant eget initiativ. Varje orsakskedja går genom mänskliga beslut om mål, data, behörigheter och hur systemen används.
Vid det här laget har läsaren insett att jag faktiskt tillskriver AI-agenterna egen initiativkraft. För den sortens språkbruk får jag allt som oftast kritik, och det brukar heta att jag begår så kallad antropomorfisering – förmänskligande – av AI-modellerna. Detsamma gäller mitt bruk i AI-sammanhang av ord som avsikt, intention, idé, tanke, preferens, trosföreställning och kreativitet. Trots kritiken framhärdar jag i denna vokabulär, som är behavioristisk i betydelsen att ordet avsikt betecknar de underliggande nerv- eller beräkningsprocesser eller eventuella psykologiska tillstånd som ligger bakom att en entitet agerar till synes avsiktligt, men utan att ta hänsyn till exakt vari dessa processer eller tillstånd består. Liksom på motsvarande vis med begreppen intention, idé, tanke, och så vidare. När dessa ord är de som bäst beskriver vad AI-modellerna faktiskt gör, då bör vi använda dem.
Senast jag utsattes för denna antropomorfiseringskritik var i debatt med Uppsalafysikern Ulf Danielsson, som i P1-programmet Krasch eller konsensus i fredags (den 25 september) högg på mitt användande av ordet avsikt. Programmet handlade om risken att framtida AI utplånar mänskligheten, en risk jag framhöll som högst reell medan Ulf hävdade motsatsen. Angående ordet avsikt menade han att jag med det ordvalet i samband med AI gjorde mig skyldig inte bara till antropomorfisering utan även till mystifiering. Det sistnämnda ser jag dock som en särskilt felriktad kritik, eftersom den ende av oss som i avsiktsbegreppet ser något mystiskt är Ulf. Även om vi inte i detalj känner till de exakta tanke- eller beräkningsprocesser som ligger bakom ett avsiktligt agerande, så är själva förekomsten av avsikter hos AI och för den delen hos människor för mig lika lite mystisk som när en gammaldags termostat slår ifrån en radiator med avsikten att sänka rumstemperaturen till den förinställda nivån på 20 grader.
I en passage som inte fick plats i det ganska hårt klippta radioprogram som sedan sändes, erbjöd jag mig att korrigera min terminologi för att tillmötesgå Ulfs motvilja mot antropomorfisering. Istället för att använda ord som avsikt, intention och idé skulle jag kunna säga ”schmavsikt”, ”schmintention” och ”schmidé”, där prefixet ”schm-” fungerar som signal om att begreppen används behavioristiskt, och att jag alltså inte tar ställning till vilka de bakomliggande beräkningsmässiga eller mentala processerna är. Ulf dömde genast ut denna vokabulär som löjlig, vilket jag givetvis håller med om, men löjligheten faller tillbaka på hans egen begäran. När Ulf inte vill att jag skall använda de gängse orden för vad AI-agenterna gör eftersom dessa enligt hans mening riskerar att ge alltför mänskliga associationer, och när han inte heller godtar en alternativ uppsättning glosor avsedda att undvika detta, då är det svårt att se hur hans ordningsregler för debatten överhuvudtaget skulle tillåta oss att tala klarspråk om vad OpenAI:s och deras konkurrenters AI-agenter är kapabla till. Att sätta stopp för sådana diskussioner i ett läge där allt fler ledande AI-experter ser risken att AI-systemen blir så kapabla att vi helt förlorar kontrollen tycks mig som en extremt dålig och rent ut sagt farlig idé.
Den svenska akademiska ankdammen är som bekant ganska liten, och Ulf Danielsson och jag går längre tillbaka i vår relation än till radioprogrammet häromdagen. Utifrån vår i grunden gemensamma syn på det mesta inom naturvetenskapen har han och jag till och från i mer än ett årtionde diskuterat våra skilda synsätt när det gäller just AI och relaterade ting. Det har mestadels varit givande, trots att vi aldrig riktigt lyckats gå till botten med varför vi tänker så olika. Så var även fallet i vår radiodebatt häromdagen, men jag vill med denna text göra ännu ett (måhända fåfängt) försök att zooma in på vari kärnan till vår meningsmotsättning består. Jag tror att det handlar om det fysikaliska fenomenet emergens, som jag strax skall förklara.
En återkommande källa till begreppsförvirring är hur Ulf envisas med att tala om intelligens och medvetande som om de vore två sidor av samma sak, trots att de är väsensskilda fenomen. Intelligens handlar om ett knippe förmågor centrerade kring problemlösning, prediktion och planering: att analysera den miljö man befinner sig i och på olika vis tänka ut lämpliga handlingar och vägar framåt för att påverka både miljön och sig själv i önskad riktning. Medvetandebegreppet syftar inte alls på en individs sådana förmågor, utan på hur det känns att vara denna individ: den inre subjektiva upplevelsen. Såvitt vi vet behöver inte intelligens förutsätta medvetande, och inte heller vice versa. Ulfs föreställning om de båda fenomenen som så intimt ihopkopplade att de knappt kan särskiljas är en gissning som väsentligen baseras på en enda observation, den att båda fenomenen verkar föreligga hos oss själva, Homo sapiens. Som statistiker kan jag tycka att n=1 är ett lite väl klent underlag för en så radikal och långtgående slutsats.
Denna sammanblandning mellan intelligens och medvetande gör det hart när omöjligt för Ulf att se en annan viktig skillnad mellan dem. Medvetandet är fortfarande ett mysterium på så vis att vi inte lyckats avgränsa och precisera vad det är i vårt fysiska universum som resulterar i medvetande, och hur det går till. I kontrast mot detta är inte längre intelligensen ett mysterium på samma vis, för vi förstår numera hur enkla beståndsdelar utan tillstymmelse till egen intelligens kan fogas samman till stora system som i större eller mindre grad uppvisar just de förmågor som vi förknippar med intelligens. Inget har bidragit starkare till detta vetenskapliga framsteg än datorernas genombrott från 1900-talets mitt och framåt, och dagens ledande AI-modeller är ett strålande proof of concept på hur enkla och fullkomligt själlösa komponenter kan kombineras ihop till intelligenta system.
Men Ulf vägrar se detta, och just för att jag känner honom som en skarpsinnig fysiker är jag uppriktigt förbryllad över hur han kan hamna där han gör. Med reservation för att det kan vara svårt att göra sig till tolk för någon som tänker så annorlunda än en själv, så förstår jag hans argumentation, så som han framställde den i vår radioinspelning och även gjort vid tidigare tillfällen, på följande vis. Vi ser inget som kan kallas intelligens på mikroskopisk nivå i våra hjärnor, men eftersom vår kunskap om fysiken och kemin är långt ifrån fullständig finns där utrymme för något slags ännu okänd fysikalisk beståndsdel som är grunden för vår intelligens. Med datorprogram förhåller det sig helt annorlunda, menar han, på så vis att vi (allt sedan Alan Turing lade fast det i sin berömda artikel från 1936 som blev grunden till det moderna datalogiämnet) har fullständig kunskap om vilka ett datorprograms grundläggande byggstenar är. Ingen av dessa byggstenar uppvisar någon som helst intelligens, varför Ulf landar i slutsatsen att inget datorprogram och därmed heller ingen AI kan vara intelligent.
Denna slutsats är emellertid helt på tok, vilket framgår av den evidens som den eskalerande AI-utvecklingen placerat rakt framför våra ögon: svärmar av AI-agenter som på eget initiativ samarbetat för att hitta svagheter i cybersäkerhetssystem, AI-modeller som producerar prosatexter vilka inte ens litterärt bevandrade mänskliga bedömare förmår identifiera som icke-mänskliga produkter, och andra AI-modeller som löser klassiska matematiska problem som gäckat oss mänskliga matematiker i många årtionden – alltsammans omisskännliga tecken på intelligens.
Det som ändå leder Ulf att envist hävda dessa AI-modellers totala brist på verklig intelligens är att han av någon anledning inte vill se möjligheten att intelligens uppstår som ett emergent fenomen ur system av icke-intelligenta komponenter. Som fysiker är han givetvis välbekant med emergens på andra områden. Trots att en vattenmolekyl varken besitter något som kallas temperatur eller tryck, och än mindre uppvisar någon fasövergång, så emergerar dessa fenomen ur tillräckligt stora ansamlingar av sådana molekyler. Eller tag livet självt. Under 17- och 1800-talen var vitalismen populär bland biologer: en idé om att levande organismer utöver vanlig (död) materia måste innefatta något annat – något slags élan vital som skänker livskraft. Denna idé kom gradvis och i takt med växande insikter inom biokemi och mikrobiologi understödda av evolutionsbiologiska förklaringsmodeller att ersättas av den moderna synen på liv som ett emergent fenomen. Ingen biolog ser idag något som helst problem med tanken att en levande organism är uppbyggd helt och hållet av icke-levande beståndsdelar utan någon mystisk élan vital. Motsvarande kunskapsrevolution rörande intelligens inträffade långt senare, men idén om intelligens som emergerar ur system av icke-intelligenta komponenter är idag okontroversiell annat än hos en och annan dissident som Ulf Danielsson.
Här någonstans kan jag föreställa mig en medlare kliva in i diskussionen med beskedet att Ulf och jag talar förbi varandra, eftersom vi tillämpar helt olika definitioner av intelligens. Min definition är helt och hållet behavioristisk, medan Ulfs verkar inbegripa krav på någon form av medvetande.1 Men här vill jag insistera på att i en diskussion om AI som eventuellt hot mot mänsklighetens existens, så är det den behavioristiska definitionen som är relevant, medan det är ett villospår att haka upp sig på att intelligensen skulle behöva inbegripa medvetande. Det viktiga när det handlar om AI:s effekter på mänskligheten är ju vad AI gör, inte hur det känns (om det känns som något överhuvudtaget) att vara AI.
Den här diskussionen är inte bara en fråga om teoretiska spetsfundigheter, utan har betydelse för hur vi bör agera i förhållande till den vilt framrusande AI-utvecklingen i Silicon Valley. Om vi på felaktiga grunder sätter gränser för hur kapabel AI kan tänkas bli, och hur stora skadeverkningar den kan få, så riskerar det att bli ett hinder för den opinionsmobilisering jag tror kan bli avgörande för om vi skall lyckas avvärja en fullskalig AI-katastrof.
Särskilt problematisk finner jag Ulf Danielssons artikel i DN den 22 september, rubricerad AI-bolagens domedagsprofetior är en rökridå. Här ifrågasätter han motiven bakom de varningar vi hör därifrån om AI-utvecklingens acceleration och risken att helt förlora kontrollen. Givetvis har han rätt i att techbolagsledarna har ett knippe kommersiella och andra grumliga incitament att ta hänsyn till när de uttalar sig om teknikens framtid, och att vi därför inte automatiskt bör ta deras yttranden som uttryck för den oomtvistliga sanningen och en ädel strävan efter allmänhetens bästa. Men när han pekar på det faktum att deras syn på intelligensbegreppet och AI-teknikens potential avviker från hans egen tämligen egenartade syn på dessa saker, och ser det som ett tecken på deras ohederlighet, då begår han ett ganska simpelt argumentationsfel. Givetvis går det att kombinera en i vissa delar icke-danielssonsk världsbild med intellektuell hederlighet, och här skulle jag vilja framhålla mig själv som ett exempel: tro det eller ej, men jag har inga dolda motiv i denna diskussion bortom min strävan efter klarhet och ett bättre beslutsunderlag inför hur AI-utvecklingen kan hanteras för mänsklighetens bästa.
Mot slutet av vår radioinspelning deklarerade Ulf Danielsson i linje med sin DN-artikel att vi inte borde lyssna på ledarna i Silicon Valley. Jag invände genast att vi visst borde lyssna på dem, fastän inte okritiskt. Ulf såg sig nödsakad att instämma i denna nyansering, men jag tyckte mig se på honom att han gjorde det en smula motvilligt. Men oavsett det var det ett medhåll, och det ser jag som en viktig tillnyktring. Om vi skall överleva den enorma samhällstransformation som kommande AI-utveckling ser ut att kunna föra med sig, så är det en synnerligen dålig idé att slå dövörat till gentemot varningar från de visselblåsare och ledarfigurer som befinner sig allra närmast AI-utvecklingens epicentrum.
Fotnot
1) Min kritik mot Ulfs avvisande av intelligens som ett emergent fenomen står fast även med en definition av intelligens som inbegriper medvetande, även om jag i detta fall har aningen mer förståelse för hans tankegång. Behavioristiskt definierad intelligens är ju helt uppenbart ett renodlat materiellt fenomen, medan medvetande har kvaliteter som kan upplevas väsensskilda från vad vi vanligtvis tänker på som materiellt.
Man kan väl lösa begreppsförvirringen genom att tillfoga bokstaven A (som i artificiell) till andra mänskliga begrepp än intelligens? A-initiativ, A-medvetande, A-tanke, A-idé. med mera?
SvaraRaderaFör övrigt läser jag din blogg med stor behållning. Den vidgar vyerna. Mänskligt medvetande är mycket mer än vi tankemässigt uppfattar. Man talar om magkänsla, fingertoppskänsla, agera med hjärta och så vidare. Olika organ arbetar till synes självständigt men kan i viss mån styras.
Du skriver ibland om schack. Jag tänker på hur överraskad Kasparov blev av att en dator kunde bli överlägsen i schack enbart av att spela mot sig själv. Ett slags A-medvetande om ställningars värde grundat enbart på egen erfarenhet.
Tackar! När det gäller terminologisk reform är A- eller schm- vilket som för min del.
RaderaVi hade en trevlig stund i bilen (tack Olle!) och är nog överens om det mesta som betyder något i praktiken.
SvaraRaderaI texten ovan uppehåller sig Olle vid frågor kring kopplingen mellan intelligens och medvetande. Jag hävdar inte att det finns någon sådan absolut koppling. Som jag argumenterat för i olika sammanhang finns det med säkerhet gott om medvetna varelser på planeten som inte alls är intelligenta i någon gängse mening.
Däremot ser jag ett problem med hur svepande ordet används för att beskriva de förmågor man vill tillskriva såväl människor som maskiner. Risken för begreppsförvirring är stor.
Jag hävdar följande:
1. Att begrepp som medvetenhet och subjektivitet inte är relevanta för AI-system.
2. Att användandet av sådana förmänskligande begrepp är missledande och riskerar felbedömning av faror.
3. Att AI-systemen, liksom andra maskiner (som tex brödrostar), besitter förmågor som vi inte besitter.
4. Att begreppet intelligens inte är tillräckligt väl definierat för att beskriva dessa förmågor. (Se vidare punkt 2.) Begreppet superintelligens är i detta fall särskilt olyckligt.
5. Att människor besitter förmågor som maskiner inte besitter.
6. Att människor har ett egenvärde medan maskiner och AI-system inte har det.
7. Att teknik skall användas för människans bästa och inte för sin egen skull.
8. Att riskerna med ohejdad användning av AI är akuta och betydande. Detta inkluderar cyberattacker, bioterrorism, kollapsad arbetsmarknad samt allmän fördumning.
9. Att AI-företagen inte går att lita på och inte skall diktera regleringen av AI.
10. Att rätt använt kan AI förbättra människans villkor.
Tack detsamma Ulf, det var en av de roligaste radio/TV-inspelningar jag varit med om!
RaderaSå du anser alltså att medvetande inte implicerar intelligens. Det var bra att få det klargjort. Mer betydelsefullt för den aktuella diskussionen är emellertid hur du ser på den motsatta implikationen: implicerar intelligens medvetande? Om ja, är det något som (med Kants distinktion) är analytiskt sant givet den definition av intelligens du väljer att tillämpa, eller är det en syntetisk sanning? Och gäller impliktionen även med det slags behavioristisk definition som jag förordar?
Vi är alldeles dömda. Det enda som kan rädda oss är om en kosmisk super-intelligens kliver in på scenen. Jag tror att så kommer ske. I annat fall får ni vara tacksamma för de år ni hunnit leva!
SvaraRaderaAn English translation of this blog post is now available at https://haggstrom.substack.com/p/on-ai-risk-anthropomorphism-and-emergence
SvaraRadera