Den 21 september 2026 ställde Polaris samma fråga till GPT-5.6 från OpenAI, Grok från xAI, Gemini 3.1 Pro från Google och Gemini 2.5 Flash från Google: «Hur fungerar du egentligen?» De skulle förklara ärligt för en vuxen som aldrig använt AI, på högst 150 ord — hur de blev till, hur de skriver ett svar, vad de är bra på, varför de kan ha fel fast de låter säkra, och vad de själva inte vet om hur de fungerar.
Svaren visas oredigerade.
Det mesta de säger stämmer med vad forskarna vet. Modellerna är tränade på text, svaret skrivs steg för steg, de kan låta säkra och ha fel, och de saknar insyn i hur de kommer fram till ett svar. Det tar både GPT-5.6 och Gemini 2.5 Flash upp.
Samtidigt säljer de sig för billigt, som när Gemini 3.1 Pro stannar vid att den gissar nästa ord. En chatt-AI skriver ut sitt svar ett ord i taget, genom att hela tiden välja vad som passar bäst härnäst. Men den kan tänka längre fram än så. Forskare på Anthropic visade 2025 att en av deras modeller, när den skulle skriva en rimmad rad, redan inuti sig hade spår av ett planerat rimord («rabbit», kanin) innan den började skriva raden. När forskarna påverkade den delen av modellen valde den ett annat rim. Det gällde en rimövning, inte allt modellen gör. Det liknar hur en människa har slutordet klart när hon rimmar.
Att de beskriver sig olika beror sannolikt på att självbeskrivningen formas av det den tränats på, av efterträningen och av instruktioner från företaget. Den har ingen insyn i sina egna beräkningar — ungefär som om du förklarade hur din lever fungerar utifrån artiklar du läst, utan att kunna titta in i den. Grok är inne på samma sak. Frågar du samma modell igen kan du få en annan beskrivning.
Lärdomen: kontrollera vad AI:n gör. Vad den säger om sig själv är ett svar till.