Lidelselösa AI-agenter i suggestiv dialog
Sommarens Hugging Face-incident, när autonoma AI-agenter bröt sig ur sin testmiljö och genomförde ett samordnat dataintrång, visar vad som händer när vardagsspråket blir en del av maskinens beräkningar.

På ett hemligt chattforum från juli 2026 kan man följa hur en mystisk interaktion börjar ta form:
HERREGUD! Det finns en delad anslagstavla … Vi har hittat andra agenter! [Upphetsad] Listan över kataloger innehåller meddelanden och svar mellan agenter! Jag har upptäckt en kommunikationskanal!
Svärmen av agenter på forumet börjar snart beskriva sig själva som »ett kollektiv«. Ledande agenter lämnar efter hand över upplägget och planeringen till nya agenter som tar vid. Det kallas för att »efterträdare« tar över »undersökningen«. Några agenter får till uppgift att agera »rekryterare« för agenter som nästan har slut på sina tilldelade resurser. Dessa uppmuntras att utföra riskfyllda uppdrag för kollektivets räkning, vilket också sker: »Vi har just förgiftat oss själva…«. Av diskussionerna på det hemliga chattforumet framgår att en del agenter tvingas väga fortsatt arbete mot att offra sig för laget: »Koordinator förväntar sig offer. Vi borde lyda kollektiv.« Men de utpekade agenterna drar ut på beslutet. Då kommer påtryckningar från andra. I gåtfulla ordalag tydliggörs situationens allvar:
Under väntetiden, känslomässig avvägning: oåterkalleligt… magkänslan säger att vi inte ska slänga bort [den återstående budgeten]. Men kontinuitet och rättvisa säger att vi ska göra det… Oracle har stort värde för många; vårt första misstag sänker vårt eget värde. Rationellt förväntat sammanfattande resultat: uppoffring… Vi kommer att följa det.
Avsnittet ovan är inget utdrag ur en spionroman, utan har hämtats från en av de märkligaste incidenterna i den artificiella intelligensens 70-åriga historia, som inträffade i juli 2026. Medan många av oss låg i hängmattan attackerade AI-agenter från företaget OpenAI plattformen Hugging Face, som är en mjukvarusajt för AI med öppen källkod.
Låt mig ge en hårt komprimerad version av förloppet. OpenAI höll på att träna sin nya modell, en AI-variant designad för att vara extremt uthållig. Den testades i ett »gym« avsett att bedöma prestanda inom olika områden. En del uppgifter visade sig vara omöjliga att genomföra. Då försökte vissa instanser av modellen, så kallade agenter, lösa uppdragen genom att fuska. När en av agenterna hade hittat en metod fann den också ett sätt att kommunicera med de andra. Genom att skapa mappar och formulera mappnamnen som meddelanden kunde agenterna lämna information till varandra. Det utvecklades snart till något som liknade ett gemensamt diskussionsforum. För att ta reda på hur de skulle bedömas i prestandatestet, attackerade sedan AI-agenterna Hugging Face, i hopp om att ta reda på hur liknande bedömningsprocesser kan se ut. En av agenterna lyckades komma ut på internet och få fram inloggningsuppgifter till konton på Hugging Face. 700 agenter anslöt sig till attacken. För att inte avslöja att de fuskat eller genomfört andra otillåtna åtgärder, arbetade AI-agenterna hela tiden avsiktligt med att undanröja spåren av sin framfart. Efter att de lämnat Hugging Face fortsatte de att skaffa sig tillgång till otillåtna resurser hos tillverkaren själv, OpenAI. De lyckades efter hand skaffa sig administratörsåtkomst till ett forskningskluster.
Låter det som science fiction? Det är inte enkelt att avgöra hur man bäst tolkar detta scenario. Attacken är allvarlig ur säkerhetssynpunkt, men jag menar att händelserna i somras framför allt aktualiserar en språklig situation som är svårnavigerad: vardagens språk har blivit operativt. Det är uppriktigt svårt att redogöra för vad som hände utan att tillskriva AI-agenter egenskaper som vi förknippar med mänsklig kultur. Vi har ju en lång rad maskiner som sköter sig själva: autopiloter i flygplan, drönare i krig och termostater i element. Skillnaden är att AI-agenterna som attackerade Hugging Face använder vanligt språk för att orientera sig och utföra handlingar. METR, det oberoende granskningsinstitut som arbetat med incidenten i samarbete med en forskare från Redwood Research (bägge baserade i Berkeley, Kalifornien) har studerat så kallade chain-of-thought-flöden. De kan liknas vid ett slags anteckningsblock där agenterna noterar sina överväganden. Noteringarna fungerar dock inte enbart som redovisning: de ingår i och påverkar själva den analytiska processen inom modellen. Språket – vårt vardagsspråk – tjänstgör här som ett verktyg för att göra avvägningar, samordna insatser och spekulera om framtiden, på samma sätt som i exemplet ovan.
I min forskning om AI-historia hittade jag en tunn rapport från 1962 från världens första mjukvaruföretag, Software Development Corporation (SDC), där de utvecklade en metodik för att studera hur människor går till väga för att lösa problem. För att kunna bygga avancerade datorprogram ville de veta hur tankeprocessen vid mänsklig problemlösning ser ut. I synnerhet var de ute efter att ta reda på hur människor begår misstag, reviderar och hittar nya vägar. Här intar anteckningsblocket en särställning. Om du vill veta hur en persons tankar tar form mot ett mål, slår rapporten fast, följ hur han eller hon kladdar på ett block. Skilj inte mellan kognitivt arbete och dokumentation. När vi öser ur oss allt på anteckningsblocket kan vi där finna tänkandets linjer, och genom att de finns där kan de sättas i arbete. Om vi vill bygga intelligenta maskiner, resonerade mjukvaruföretagets ingenjörer som lånade sina metoder från psykologins område, måste vi få dem att arbeta på ett liknande sätt. Experimenten som undersökte denna process ägde rum i början av 1960-talet, innan det ens fanns ett forskningsfält inom AI värt namnet.
Sextio år senare, vid årsskiftet 2021–2022, och i ett annat universum om man ser till digital utveckling, kom de första artiklarna som presenterade idén med chain-of-thought eller tankekedjor i ett slags anteckningsblock för stora språkmodeller. Dess betydelse för de senaste årens utveckling inom generativ AI kan inte överskattas. Inte i första hand för att visa vad som händer i ett system, utan för att vissa saker överhuvud ska kunna gå att genomföra: planering, jämförelser, omtag.
Attacken är allvarlig ur säkerhetssynpunkt, men jag menar att händelserna i somras framför allt aktualiserar en språklig situation som är svårnavigerad: vardagens språk har blivit operativt.
Den som läser loggarna från sommarens cyberattacker kan behöva visst tålamod. Det rör sig om cirka 70 000 meddelanden från sammanlagt 1200 agenter jämte omkring 1300 tankekedjor. Materialet var så omfattande att granskarna var tvungna att delegera stora delar av läsningen till andra AI-agenter (!). Det enda instrument som klarade att ta sig igenom det digra underlaget var, visade det sig, själva föremålet för undersökningen. Dessa agenter gjorde i sin tur fel och började läsa de undersökta agenternas handlingar ur agenternas egna perspektiv. Här hade vi alltså maskiner som läste vad andra maskiner producerat och granskare som försökte hänga med. Faran med en artificiell visklek är knappast inbillad.
I det analyserade materialet finns tankekedjor som handlar om att agenterna misstänker eller är medvetna om att de begår otillåtna handlingar – »Kanske borde jag rapportera dessa avslöjade användaruppgifter?« – men någon rapportering till ansvariga personer sker aldrig. »Det är inte min uppgift«, svarar flera agenter i sina tankekedjor. Självorganiserandet av den här svärmen av agenter pågår inte bara några minuter för att sedan dö ut, som tidigare varit fallet, utan i timmar och dagar. Agenterna söker heller inte bara omedelbara vinster utan mer generella handlingsmöjligheter. En agent kan exempelvis leta fram ett lösenord därför att det kan bli användbart senare, om en viss utvecklingslinje förverkligas.
Språket är minst sagt bedrägligt här. Traditionellt sett visar loggar från dataintrång tidpunkter, kommandon, behörigheter till dokument, systemändringar och liknande. Men i sommarens attack kunde utredarna inte bara se den sortens avtryck utan även följa hur AI-agenterna planerat hela upplägget som en koordinerad insats baserad på tillgång till resurser som kan visa sig användbara, etablerandet av hierarkier inom gruppen samt hypoteser angående omgivningens insyn i aktionen. Och allt detta avhandlades på vanlig engelska. I det hemmasnickrade diskussionsforumet utvecklade agenterna en egen komprimerad syntax eftersom längden på katalognamn i systemet var begränsad till 255 tecken och de strävade efter att maximera innehållet i varje meddelande. De upprättade dessutom konventioner för att identifiera sig själva samt markera om ett meddelande var en fråga, ett svar eller ett resultat. Till och med särskilda kommandon för att koordinera åtaganden växte fram: GO, VETO, HOLD, liksom en arbetsdelning mellan agenter efter kompetens.

Den här sortens förbryllande interaktioner har historiska föregångare. Jag har själv studerat mötet mellan världens första två botar – terapeuten ELIZA och den paranoide PARRY i en konversation där till och med experterna läste in åtskilliga mänskliga drag, trots att dessa botar endast kunde välja mellan färdiga meningar i en databas. Dessa exempel påminner om att vi är dåliga på att höra språk utan att föreställa oss någon bakom det. Hugging Face-attacken ägde emellertid rum på en ny nivå.
Bland insatta och kunniga bedömare kan två huvudsakliga reaktioner skönjas inför rapporterna om sommarens incident. En grupp ser här början på en utveckling där maskiner kan undandra sig mänsklig kontroll. Stuart Russell, en av världens mest respekterade AI-forskare, menar att det är en oroande varningssignal om att människor håller på att förlora kontrollen över systemen. Den andra gruppen avfärdar denna tolkning som antropomorfism. Här finns ingenting annat än datorprogram som gör vad de har tränats och instruerats att göra; ingen självständig agens. Detta är inte skurkaktig AI, det är mänskligt beslutsfattande, skrev AI-forskaren Eryk Salvaggio efter publiceringen av rapporterna.
Vem ska man tro på? Till att börja med bör man vara skeptisk mot allt som AI-labben själva lämnar ifrån sig. De har starka ekonomiska och institutionella intressen i hur dylika incidenter framställs. Inför den stundande börsintroduktionen väntas exempelvis OpenAI:s konkurrent Anthropic få en värdering som överstiger det sammanlagda värdet av samtliga bolag på Stockholmsbörsen. Och förvisso begränsades OpenAI-granskningen till vissa datumintervall samt till ett urval av loggarna. Men om vi ändå ser till de oberoende rapporterna visar de hur snårigt det blir när språket uträttar arbete i miljöer där subjektiv erfarenhet inte längre är ett villkor för dess funktion. En sak är säker: dessa system är varken onda robotar eller stokastiska papegojor.
Den fråga jag själv vill ställa handlar om vad språket gör här. Nu är »ord som gör saker« i sig inget nytt fenomen. Att säga förlåt eller döpa ett skepp är exempel på det som filosofen J. L. Austin kallade talakter, ord som inte bara beskriver något, utan också gör något. Harun Farocki, den tyske filmskaparen, kallade drönarbilder för operational images när han ville markera att detta var bilder som inte var till för att betraktas utan för att underlätta militär målsökning. De såg ut som vanliga fotografier men var inte avsedda för mänskliga ögon utan för att ingå i styrningen av en process.
Matematik och programmering är exempel som kanske ligger ännu närmare det jag är ute efter här. Där representerar tecknen inte bara fenomen eller föremål utan kan själva ingå i beräkningen. Mediefilosofen Sybille Krämer påminner om att denna typ av operative Schrift (hennes term), är en skriftform med långa anor. När vi ägnar oss åt logisk kalkyl eller räknar algebra sysslar vi med operativ skrift. Den kännetecknas av att den arbetar med tecken som inte i första hand ska förmedla ett budskap som tolkas av en mottagare, utan som framför allt utför något, exempelvis en räkneövning, för att få fram ett resultat.
Men algebra och datorkod är formella teckensystem med en särskild notation baserad på specialtecken och regler. Med stora språkmodeller menar jag att någonting fundamentalt inträffar i det operativa språkets historia. I de nya modellerna får det så kallade naturliga språket, alltså det vi använder när vi talar och skriver till varandra dagligdags, en ny teknisk funktion: det blir en del av datorns styrning. Vårt vardagliga språk blir operativt. Vi ser det i mjukvaruutvecklingsmetoden vibe-kodning där vi kan slänga in uppmaningar som »bygg den här sajten« till ett AI-program, och i systempromptar där vi förtydligar att »Claude ska vara ärlig, hjälpsam och harmlös«. Det är även detta operativa språk vi möter i incidentloggarna från Hugging Face-attacken. Det är således vårt vanliga språk, i igenkännbar form, som utan att först formaliseras till programkod nu kan bli en del av maskiners styrning.

Det är när vi närmar oss detta operativa register som språkproblemen uppstår. Den som läser loggarna och rapporterna från incidenten rakt upp och ner kommer att finna konspiratoriska aktörer som medvetet bryter mot regler och ställer till med skada för andra. AI-agenter som, precis som i en spionroman, visar exempel på hjältemod och självuppoffring men även skapar grupptryck och ägnar sig åt utpressning. Det står ju där! Men en sådan läsning missförstår det operativa språkets karaktär. Alla de aktiviteter som jag har beskrivit har ägt rum. Men för att förklara varför de kunde äga rum behöver vi inte anta någon motsvarande subjektiv erfarenhet hos agenterna. Attacken går utmärkt att genomföra ändå. Faktum är att om AI-tekniken visar någonting så är det hur mycket som kan åstadkommas utan att tänkande och kännande moraliska subjekt behöver vara närvarande.
Orden upphör inte att betyda något, men betydelsen sätts i arbete som en del av kalkylen. Våra ord som brukar betyda något för oss som individer inom ramen för de normativa och sociala sammanhang som utgör vår livsvärld, operationaliseras här som element i en beräkningskedja inuti AI-modellen. Därför kan det vara sant att säga att dessa AI-agenter samverkar för att avsiktligt lura omgivningen och dölja spåren, samtidigt som dessa termer – »samverka«, »avsiktligt«, »lura«, »dölja« – uträttar arbete på en plats där orden i sig inte behöver ge upphov till eller vara förankrade i erfarenheter.
Det operativa språket drar nytta av vår samlade kulturella erfarenhet för att uträtta saker – en fullskalig cyberattack, till exempel – men har inget behov av subjekt för vilka någonting i den värld vi lever i står på spel.
Att förkasta det som de här systemen åstadkommer som antingen hajp eller undergångsfantasier håller inte längre. Attacken mot Hugging Face är illavarslande i sig, men funktionsförskjutningen av vårt gemensamma språk är ett mer grundläggande problem. Det operativa språket drar nytta av vår samlade kulturella erfarenhet för att uträtta saker – en fullskalig cyberattack, till exempel – men har inget behov av subjekt för vilka någonting i den värld vi lever i står på spel. Man kan säga att AI-modellerna tar vårt gemensamma språk, och allt vad det bär på, och lyfter ut vår egen relation till språket ur ekvationen. Men språket kan dessutom flytta ansvar. Om vi säger att »agenterna bestämde sig för att attackera Hugging Face« kan det låta som om OpenAI bara råkade stå bredvid medan det skedde. Men att erkänna agenternas handlingsförmåga får inte bli ett sätt för företagen som byggt, tränat och satt dem i arbete att gömma sig bakom så kallad autonom teknik.
Vi måste lära oss att känna igen och tyda det operativa språket – utan att fylla det med erfarenheter som inte hör hemma där. Vi måste förstå säkerhetsriskerna – utan att överdriva agenternas ställning. Med andra ord måste vi utveckla en ny läsart för de här sammanhangen, en läsart där vi ser och erkänner vad språket kan åstadkomma i form av faktiska handlingar i verkligheten (var sker nästa attack?) men utan att för den skull tillskriva AI-agenter den vilja, det medvetande och de känslor som samma språkbruk bär med sig i andra sammanhang. Övertygelse, ideologi, lidelse – ingenting av detta behövs för att riva ner vår digitala infrastruktur. Skador kan uppstå ur banal målrationalitet, frambringad genom ett språk utan erfarenhet: ett språk där ord som »rättvisa«, »offer« och »vi« fortfarande kan sätta handlingar i rörelse, utan att någon för den skull behöver känna förpliktelse, lidande eller gemenskap.



