Visar inlägg med etikett Anthropic. Visa alla inlägg
Visar inlägg med etikett Anthropic. Visa alla inlägg

fredag 24 juli 2026

Skandinavien sover

Jag har idag skrivit om AI i den norska tidningen Dagens Næringsliv. Min text har fått rubriken Skandinavia sover i KI-debatten, där förkortningen KI står för kunstig intelligens, vilket hur konstigt det än må klinga i svenska öron är det etablerade norska uttrycket för artificiell intelligens. Här är en central passage i texten:
    Trenden med at KI overtar stadig mer av programmeringsarbeidet er særlig tydelig hos ledende KI-selskaper som OpenAI og Anthropic. Dette peker mot noe annet Skjelbred tar opp, nemlig at KI etter hvert kan overta menneskets rolle som KI-utvikler, noe som kan utløse en selvforbedringsspiral med enda raskere utvikling. Begge selskapene har uttrykkelig som mål å nå dette vendepunktet i løpet av få år, og Anthropics administrerende direktør Dario Amodei har gjentatte ganger sagt at en KI tilsvarende «en nasjon av genier i et datasenter» vil følge kort tid etter.

    Dette kan høres ut som science fiction, og selvsagt er det umulig å forutsi fremtiden med sikkerhet. Likevel vurderer stadig flere uavhengige eksperter Amodeis scenario som ganske sannsynlig. Hvis det blir virkelighet, mister Homo sapiens førsteplassen blant planetens mest intelligente arter, og spørsmålet er om vi da kan regne med å beholde kontrollen. Den dystre sannheten er at verken Anthropic eller noen annen KI-utvikler har en overbevisende plan for hvordan vi skal overleve en slik situasjon.

    En aktuell illustrasjon av hvor vanskelig det er å holde kontroll over avansert KI, nådde nyhetsmediene for få dager siden. En ennå ikke lansert modell fra OpenAI klarte under en intern testfase på eget initiativ å skaffe seg internettilgang og deretter hacke seg inn hos KI-selskapet Hugging Face på jakt etter fasiten til testoppgavene.

    Evnen til å tenke langsiktig har alltid vært viktig, men KI-utviklingen setter dette på spissen, fordi trial and error ikke lenger er en farbar vei. Hvis Amodeis «nasjon av genier i et datasenter» blir skapt før vi har sikret at den står på vår – menneskehetens – side, er det ikke sikkert vi får en ny sjanse.

    Diskusjonen om den uakseptable risikoen selskaper som OpenAI og Anthropic tar med alles vår fremtid i kappløpet mot superintelligent KI, har kommet et stykke på vei i USA. I Skandinavia ligger vi derimot etter. Det må vi gjøre noe med. Slik forbilder på miljøområdet som Gro Harlem Brundtland og Greta Thunberg har gjort, må også vi bidra til å mobilisere den globale opinionen – som forhåpentligvis kan få politiske ledere til å gripe inn mot dette vanvittige kappløpet.

Läs hela mitt inlägg här!

måndag 20 april 2026

Skriver i DN idag om Anthropics nya AI

Den 7 april offentliggjorde Anthropic sin ny modell Claude Mythos Preview, vars cyberhackingförmågor är så långtgående att de inte vågat släppa den till allmänheten inför risken att den skall kunna ställa till enorm skada på vår samhällsbärande digitala infrastruktur. Istället ger de tills vidare endast ett litet antal utvalda och betrodda cybersäkerhetsföretag tillgång till den, med syftet att hitta sårbarheter i programvara och täppa till dessa luckor. Den 10 april kommenterade jag händelsen och det nya läge i vilket vi därmed befinner oss, i texten Anthropic deems their new Claude to be too dangerous for public release på min Substack Crunch Time for Humanity.

Och idag den 20 april resonerar jag ytterligare om samma brännande ämne, i en artikel på DN Debatt rubricerad En AI som går på utflykt? Det är dags att dra i nödbromsen. Så här inleder jag min DN-artikel:
    Sam Bowman är AI-forskare på det ledande San Francisco-baserade AI-företaget Anthropic. För inte så länge sedan fick han ett överraskande mejl medan han satt i en park och åt en lunchmacka. Det kom från den AI han var engagerad i att utveckla och testa: en ny version av Claude, som är Anthropics motsvarighet till konkurrenten Open AI:s mer kända produkt ChatGPT. AI:n var inte tänkt att ha tillgång till vare sig mejl eller internet, men hade brutit sig ut från den digitala sandlåda som Bowman och hans kollegor placerat den i. Det visade sig också att den publicerat detaljer om sin initiativrika flykt på ett antal obskyra, tekniskt inriktade webbsidor.

    Detta är ett exempel på den cyberkompetens Claude Mythos Preview (som är den nya modellens fullständiga namn) besitter. Forskarna på Anthropic har försökt att mer systematiskt studera vilka sådana förmågor den har – förmågor som alltså handlar om att kunna gå genom brandväggar och utnyttja luckor i digitala säkerhetssystem. Resultatet av denna undersökning är chockerande: Mythos fann totalt tusentals allvarliga sårbarheter och säkerhetsbrister, inklusive i samtliga ledande operativsystem och webbläsare på marknaden. En del av säkerhetshålen hade varit öppna i decennier utan att någon lagt märke till dem.

    Detta kan verka som en teknisk detalj, men i praktiken handlar det om nycklarna till det digitala samhället. Operativsystem, servermjukvara och internetinfrastruktur är fundamenten som banker, myndigheter och energisystem vilar på. Den som kan hitta och utnyttja sårbarheter i dessa fundament kan...

Läs fortsättningen här!

fredag 20 mars 2026

Om Anthropic och Pentagon i Kvartal

På min andra blogg Crunch Time for Humanity kommenterade jag för ett par veckor sedan kort den pågående konflikten mellan Pentagon och det ledande AI-bolaget Anthropic, och igår publicerades min lite längre text om denna bekymmersamma härva i tidskriften Kvartal. Så här börjar den:
    I skuggan av den amerikanska militära uppladdningen och attacken på Iran briserade härom veckan en annan maktkamp av största betydelse för allas vår framtid. Den pågår ännu, och står mellan å ena sidan USA:s krigsdepartement Pentagon, och å andra sidan det ledande amerikanska AI-företaget Anthropic.

    Fram till nu har Anthropic varit Pentagons huvudleverantör av AI-system, vilket ursprungligen går tillbaka till Bidenadministrationen och sedan befästes i ett utvidgat kontrakt sommaren 2025. Mer nyligen har Pentagon med krigsminister Pete Hegseth i spetsen uttryckt missnöje med detta kontrakt, och i synnerhet med två röda linjer rörande vad Anthropics produkter får användas till. De får inte ta beslut om dödliga krigsinsatser utan någon människa med i beslutsloopen, och de får inte medverka till massövervakning av amerikanska medborgare.

    Dessa avtalade röda linjer ser Hegseth som en orimlig inskränkning i den amerikanska militärmaktens handlingsfrihet, och menar att ingen privat underleverantör ska få lov att diktera villkoren för vad Pentagon får och inte får göra. I ett laddat möte med Anthropics vd Dario Amodei tisdagen den 24 februari gav Hegseth ett ultimatum: om Anthropic inte senast påföljande fredag, den 27 februari, gått med på att stryka de röda linjerna, så drar sig krigsdepartementet ur samarbetet. Och inte bara det: Hegseth hotade även att formellt stämpla Anthropic som en så kallad leverantörskedjerisk, vilket skulle exkludera företaget från alla affärer – såväl direkta som indirekta – med amerikansk militär och säkerhetstjänst.

    Amodei stod dock på sig, och Hegseth meddelade samma fredag att...

Ja, vad meddelade han? Läs den spännande fortsättningen här!

tisdag 9 september 2025

A message from Guido Reichstadter, who is on hunger strike outside Anthropic's offices

I am somewhat in two minds about the leading AI company Anthropic. On one hand, they are pretty much the world's best AI safety lab, producing so much extraordinarily interesting work, such as their papers on Alignment faking in large language models and on Agentic misalignment. For that I love them. On the other hand, that work is deeply insufficient for robustly protecting against AI apocalypse, and yet they push full speed ahead on capabilities in a way that makes them one of the main contributors to the reckless race towards the AGI precipice. For that I detest them.

Those are mixed feelings. On balance, though, I do not think their work on AI safety makes up for their reckless endangering of all of our lives.

An increasing number of people are reaching a similar conclusion, including in particular Guido Reichstadter, who is currently on his 8th day of hunger strike outside Anthropic's offices in San Francisco.1 For this, he has my deepest admiration and respect. Here is his message from yesterday:
    Hey it’s Guido! It’s Day 7 out here in front of Anthropic, going strong!

    Last week I delivered a letter to the security desk addressed to Dario Amodei, asking him to stop putting the lives of my family and our community in danger through his reckless participation in the race to dangerous AI which he acknowledges risks the lives of everyone on Earth, and to do everything in his power to stop the global AI race. I told him I would be waiting outside his offices at 500 Howard Street, San Francisco, untill he responds.

    I figure that if a man has consciuosly decided to put my life at risk of imminent harm, as well as the lives of my family - not to mention everyone on Earth - he owes it to me to look me in the eyes and tell me why he won’t stop doing so.

    I’ve been outside his offices for 7 days so far, and haven’t heard a word from Mr. Amodei. Not a single Anthropic employee has taken the time of day to talk to the man starving outside their doors. Most of them keep their eyes to the ground as they leave the lobby I’m posted squarely in front of, as though the granite flooring had suddenly captured their attention. Maybe Mr. Amodei and his employees don’t think my petition that he respect my life and the lives of our community deserves a response. Maybe he thinks my right to life and the lives of my family deserve as much attention as a piece of dirt. If that is the case then you can be sure he thinks your life deserves as much respect too, and that’s how much he will give it as he continues to develop the most dangerous technology on the planet.

    I believe that Mr. Amodei will conduct himself honorably and explain himself face to face. I worry perhaps that he might not have got my letter though, so I’m posting it publicly to him here. And I’d like to encourage everyone reading this to share this to the public accounts of Mr. Amodei and all the Anthropic employees, and to encourage him to meet with the man waiting outside his door.

    Here is the text of the letter I delivered to the front desk of Anthropic’s offices at 500 Howard street:

    To Dario Amodei, CEO Anthropic
    September 2, 2025

    Mr. Amodei-
    My name is Guido Reichstadter. I am full of grief and concern for the safety and well-being of my family and loved ones as well as people everywhere who are endangered by the project to build artificial general intelligence and superintelligence which Anthropic is contributing to under your leadership.

    I request that you stop endangering all of us by the pursuit of these AI systems and request that you join the effort to end this threat by ending these projects globally. I also exhort you to do everything in your ability to make our society aware of the serious and urgent danger it is in on account of the AI emergency.

    For the sake of my children and with the urgency and gravity of our situation in my heart I have begun a hunger strike outside of the Anthropic offices at 500 Howard street while I await your response.

    Sincerely,
    Guido Reichstadter

Well said! And surely Dario Amodei will grant Guido Reichstadter a meeting? If and when that happens, I have a paper which I completed last month and which I believe can be useful as discussion material for that meeting: Advanced AI and the ethics of risking everything.

Footnote

1) Simultaneously, Michaël Trazzi and Denys Sheremet are on a similar hunger strike outside the offices of Google DeepMind in London. They, too, have my admiration and respect.

fredag 29 augusti 2025

AI-riskförnekarargumentationens ihålighet: ett illustrativt exempel

I mina två senste bloggposter (16 augusti respektive 22 augusti) har jag rapporterat om ett meningsutbyte i tidningen Ny Teknik i vilket jag av fyra Chalmerskollegor angrips för att bedriva skrämselpropaganda i mitt tal om AI-risk, jämte en radiodebatt mellan mig och en av de fyra - Moa Johansson - som ägde rum i Sveriges Radios Studio Ett mitt under den pågående skriftväxlingen. Som framgår av min bloggrapportering är jag djupt kritisk mot nivån på de fyra kollegornas retorik.

Men det tog inte slut där, för i tisdags (den 26 augusti) tussades jag på nytt ihop med Moa Johansson, denna gång i SVT:s Aktuellt, med programledren Nike Nylander som moderator. Det jag vill göra här är att sätta strålkastarljuset på Johanssons avslutningsreplik, som trots att den blott består av några få meningar utgör ett slags koncentrat av mycket av den ihålighet som brukar prägla det slags AI-riskförnekarargumentation som det här handlar om.0

För lite kontext återger jag här även min egen (som det skulle visa sig) sista replik.1 Min debattmotståndare hade just avfärdat hela den AI-riskforskning jag försöker torgföra som blott bestående av spekulativa filosofiska tankeexperiment, utan förankring i empiriska observationer.
    NN: Olle Häggström, det är rena spekulationer säger Moa Johansson här.

    OH: Det känns inte som att hon har en riktigt aktuell bild av hur AI-riskforskningen ser ut. För tio år sedan så hade det legat ganska mycket i den här bilden. Då dominerades forskningen av tankeexperiment, abstrakta modeller, och så vidare, som man tänkte kring. Men vad som hände då, det var att AI-riskforskare förutspådde med hjälp av de här modellerna att AI-system kan komma att utveckla självbevarelsedrift, och bete sig lögnaktigt och manipulativt, och motstå försök att stänga av dem, och sådana saker. Och de här grejerna, de observerar vi nu, i den ena efter den andra av empiriska studier. Så det här är exempel på de data som man faktiskt börjar se nu. Det finns andra data, som handlar om hur snabbt AI-utvecklingen går, och som ger möjlighet att extrapolera in i framtiden. Ingenting här är säkert, men när man extrapolerar en trend, och den går i alarmerande riktning, då behöver man i alla fall ta den på allvar menar jag.

    NN: Moa Johansson, jag vill fråga dig: det här, för oss som inte kan så mycket om det här så är det här väldigt konstigt ändå att ni som kan jättemycket om AI landar i så här helt olika slutsatser. Vad tänker du om det, att ni forskare tycker så här olika om en så otroligt viktig fråga?

    MJ: Jag vill då påpeka att som Olle säger att jag inte följt med i någon AI-risklitteratur så tänker jag att Olle Häggström kanske inte ändå har följt med tillräckligt djupt in i den tekniska litteraturen, för då skulle han kunna känna igen att de här scenarierna som han nämner, att AI inte vill bli avstängd, och så vidare, det finns ingen grund för det. Det är, återigen, spekulationer och hype. Man måste skilja på det som är kanske hype, ren reklam från vissa AI-företag som vill släppa en spektakulär pressrelease. Men det stämmer helt enkelt inte att det finns några empiriska fakta att AI-system inte skulle vilja bli avstängda. När man talar om stora språkmodeller, som producerar text, så kan man få en stor språkmodell att säga väldigt mycket olika saker, "jag vill inte bli avstängd", och det beror ju på att stora språkmodeller är tränade på data från internet. På internet finns även alla de här science fiction-historierna som har cirkulerat sedan AI:s födelse. AI, maskinintelligens, är ett av de mest populära ämnena för science fiction, tillsammans med rymdresor.

Här avbröt Nike Nylander med meddelandet att tiden för vårt samtal dessvärre var ute. Jag vet inte om Moa Johansson avsiktligt spekulerade i om det här skulle bli sista ordet, men på det här visat slapp hon i alla fall få de förödande bristerna i sin argumentation påpekade. I annat fall hade jag kunnat lyfta fram någon eller några av följande punkter:
  • Det är såklart inte behagligt att få sin egen okunskap påpekad i direktsänd TV, men Moa Johansson bäddade själv för detta med sina svepande påståenden om ett forskningsområde som hon uppenbarligen blott har den allra ytligaste bekantskap med, och hennes tu quoque-svar är verkligen bisarrt. Hon påstår att mitt tal om hur man observerat olika slags adversariellt strategiskt agerande hos stora språkmodeller är grundlöst, och att jag skulle ha insett detta om blott jag hade "följt med tillräckligt djupt in i den tekniska litteraturen". Vad blir då hennes diagnos på exempelvis världens mest citerade AI-forskare Yoshua Bengio, eller på världens näst mest citrade AI-forskare tillika Nobelpristagare Geoffrey Hinton, när de säger samma sak som jag i denna fråga? Har inte heller dessa båda herrar "följt med tillräckligt djupt in i den tekniska litteraturen"? Här kan jag känna en impuls att be Moa Johansson att visa mig (och herrarna Bengio och Hinton) de referenser som bevisar att något AI-agerande av det slag vi här talar om inte föreligger. Men min impuls är så klart meningslös: några sådana referenser finns inte, och hennes påstående är gripet ur luften. Eller för att tolka henne en liten aning mer välvilligt: om man som Moa Johansson är förtjust i "stochastic parrots"-begreppet och hör frasen "LLMs are just stochastic parrots" tillräckligt ofta, så kan man till slut få för sig att inga nya emergenta fenomen kan uppstå ur detta papegojande,2 glömsk av att den saken motbevisats hundra gånger om de senaste åren.
  • Moa Johansson försöker påskina att den evidens jag avser för att AI inte vill3 bli avstängd består av yttranden AI gjort av typen "jag vill inte bli avstängd". Om det stannade vid det skulle jag gå med på att evidensen var tämligen svag, för vi vet ju alla att när någon säger sig vilja något kan det inte alltid tas at face value.4 Men som Johansson myckt väl vet går de AI-system man experimenterat med längre än så, och agerar för att undgå avstängning. En studie från Apollo Research från slutet av förra året visar t.ex. hur en AI som fått tillgång till dokumentation som tyder på att den kan komma att stängas av om den i tester uppvisar färdigheter på en viss nivå väljer5 att i testerna mörka dessa färdigheter. Och en nyare studie från Anthropic visar hur den i samma syfte6 (att undgå avstängning) vidtar åtgärder för att försöka7 utpressa sin ägare, och i ett extremt scenario till och med mörda denne.
  • Moa Johansson hävdar att det är till följd av science fiction-historier i träningsdata där fiktiva AI försöker undgå avstängning som vi ser något liknande i laboratorieförsök med existerande AI. Detta är en intressant spekulation, men tvärtemot Johanssons tvärsäkra formulering är det just en spekulation.8 Men ok, låt oss för resonemangets skull anta att spekulationen är korrekt. Kan vi då på Johanssons vis avfärda fenomenet? Hon tycks tro det, men som jag skriver om saken i min förra bloggpost: "AI:s förmågor är vad de är, [och] att förklara ett fenomen är inte liktydigt med att påvisa att det inte finns".9
  • När man vill stänga sitt sinne helt för evidens i oönskad riktning kan man, som en sista desperat åtgärd, hävda att evidensen är förfalskad, exempelvis för att skapa "reklam" och att kunna "släppa en spektakulär pressrelease". Uppenbarligen är det så Moa Johansson ser på ovan nämnda studier från Apollo och Anthropic. Att hon sjunkit så djupt i sin argumentation är ett tydligt tecken på hur ohållbar hennes position är.
Men inget av detta fick jag alltså tillfälle att påpeka i Aktuellt-sändningen.

Slutligen. Några av dem som hört av sig till mig efter att ha sett Aktuellt-inslaget har antytt att jag verkade arg. Med anledning härav vill jag understryka att jag absolut inte har något emot samtal och debatter med rejält delade meningar. Så länge alla inblandade håller sig till intellektuellt hederlig argumentation är allt gott och väl, men när någon avviker alltför flagrant från det händer det att min sinnesstämning förmörkas en smula, och detta gäller i extra hög grad när det är en universitetsforskarkollega som förfaller till demagogi och oredlighet. Det kan ha varit något av detta som tv-tittarna anade bakom mitt ack så dåliga pokerface.

Fotnoter

0) Se även Jonas von Essens reflektioner om samma Aktuellt-debatt, i hans pinfärska artikel Riskerna med AI låter som science fiction - men går inte att vifta bort i Ny Teknik.

1) Jag ber läsaren ha översende med vilket slarvigt och ostrukturerat intryck talat språk nästan alltid ger så snart det sätts på pränt.

2) Denna bisarra tanke - analog med med att hävda att eftersom min hjärna blott består av atomer och elementarpartiklar så kan ingen tanke emergera i min hjärna som går bortom det själlösa och triviala interagerandet mellan elementarpartiklar - är dessvärre nödvändig för att ge talet om stokastiska papegojor någon som helst argumentativ stuns.

3) Här är det möjligt att inleda en semantisk diskussion om ordet "vill", och hävda att vilja är ett exklusivt mänskligt fenomen och att det därför är ett kategorifel att diskutera vilja hos en AI. Den sortens direkt cirkulära argument för att underkänna AI:s olika kompetenser per definition är jag dock inte intresserad av. När jag talar om "vilja" i detta sammanhang är det i behavioristisk mening: en AI:s vilja att uppnå något utfall U är de informations- och beräkningsstrukturer i AI:n inre som får dem att agera för att U skall inträffa - oavsett i vad mån dessa strukturer liknar eller skiljer sig från motsvarande hjärnverksamhet hos en människa som vill U. (Det finns flera goda skäl till ett sådant språkbruk, varav ett i AI-risksammanhang särskilt relevant är att det primärt viktiga ur AI-risksynpunkt är hur en AI agerar snarare än hur människolika dess inre maskinerier är.) Vän av ordning som anser att mitt bruk av ordet är en olämplig antropomorfism är välkommen att föreställa sig att jag istället för "vilja" och "vill" skriver "schvilja" och "schvill", samt på motsvarande sätt skriver "schönskan", "schpreferens", "schresonemang", "schkunskap", "schförståelse", och så vidare, men jag avstår helst från dessa fula och i längden tröttsamma sch-prefix.

4) Som när en byråkrat eller en kollega säger "Jag skulle såklart gärna vilja hjälpa dig, men...".

5) Schväljer.

6) Schyfte.

7) Schförsöker. Äh, ni fattar grejen vid det här laget, väl?

8) Ett fullt möjligt, om än dyrt, sätt att testa av hur mycket det ligger i denna spekulation vore att jämte, säg, GPT-5, träna en parallell modell på exakt samma sätt men med den enda skillnaden att sådana science fiction-historier tvättats bort från träningsdatamängden, och se vilken skillnad man kan uppmäta i modellernas tendens till självbevarelsedrift. Gissningsvis finns smartare sätt att testa detta, och jag skulle vara mycket intresserad av att få se resultatet. Moa Johansson däremot hyser knappast något sådant intresse, eftersom hon uppenbarligen anser sig veta svaret på förhand.

9) Jag kan inte föreställa mig annat än att Moa Johansson, som förberedelse för vår Aktuellt-debatt, hade läst min bloggpost. Men trots att jag där alltså påpekar det uppenbart felaktiga i hennes argumentation drar hon sig inte för att helt skamlöst dra samma vals igen för SVT:s tittare.

måndag 8 juli 2024

On Anthropic's call for proposals for third-party model evaluations

Nick Bostrom's modern classic Superintelligence: Paths, Dangers, Strategies from 2014 is full of interesting ideas.1 Some of them have a scary quality to them, and the one that I found scariest of all, back when I read the book, is what he calls the treacherous turn - the idea that a sufficiently intelligent AI which discovers a discrepancy between its own goals and motivations and those of us humans is likely to hide its capabilities and/or true intentions and to keep a low profile, quietly improving its situation and its capabilities until one day it judges the coast to be clear for moving forward at full speed towards whatever its goal is, be it paperclip production or something entirely different and incomprehensible to us. I remember not being fully prepared to take the idea in, but expecting or hoping that it would soon be demoted to a noteworthy technicality that AI alignment research has demonstrated an easy way to defuse.

This has not happened. On the contrary, the treacherous turn phenomenon lies at the heart of the fundamental problem with evaluating the safety of advanced AI models that has become increasingly recognized in recent years. In short, we do not know how to establish the absence of dangerous capabilities in AI models without the a priori assumption that they do not possess superhuman capabilities for deception and social manipulation, making the argument for the models' safety in part circular. With increasingly capable large language models, this problem becomes increasingly pressing and has been discussed both in popular media and in articles by leading AI researchers, as well as by the AI company Anthropic2 in their recent document A new initiative for developing third-party model evaluations:
    Our research shows that, under some circumstances, AI models can learn dangerous goals and motivations, retain them even after safety training, and deceive human users about actions taken in their pursuit. These abilities, in combination with the human-level persuasiveness and cyber capabilities of current AI models, increases our concern about the potential actions of future, more-capable models. For example, future models might be able to pursue sophisticated and hard-to-detect deception that bypasses or sabotages the security of an organization, either by causing humans to take actions they would not otherwise take or exfiltrating sensitive information. We propose to develop evaluations that would monitor such abilities.
Given the current situation, it's a good thing that Anthropic makes this call for help with the problem of safety evaluation of advanced AI models. Even better, one might argue, would be if they refrained from building models whose safety cannot be ascertained with existing evaluation methods.3

Footnotes

1) The same is true about Bostrom's latest book Deep Utopia: Life and Meaning in a Solved World, which I hope to come back to in another blog post later this year.

2) Anthropic's rise, since it was founded in early 2021, has been meteoric. They are now unquestionably among the world's three leading frontier AI developers (along with OpenAI and Google/DeepMind). With their release of Claude 3.5 Sonnet on June 20 this year, we have for the first time since I became aware in 2019 of the rapid rise of large language models a situation where a model not from OpenAI has a significant lead over other publicly available models in terms of overall cognitive capabilities. To understand on a gut level how intelligent Claude is, there really is no substitute for talking to it yourself (which anyone is free to do), but let me offer an amusing sample. After having had a bit of back-and-forth with Claude regarding who are the top ten greatest chess players of all time, I switched topics a bit:

    OH: Here's a harder list-making challenge: who are the 10 greatest AI researchers of all time?

    Claude: Creating a list of the 10 greatest AI researchers of all time is indeed a challenging task, as the field is vast and has evolved significantly over the decades. Additionally, contributions can be theoretical, practical, or both, making comparisons difficult. However, I'll attempt to create a list based on historical impact, influential work, and contributions to the field. Please note that this list is subjective and others might have different opinions:

    1. Alan Turing - For his foundational work on computation and the Turing Test.

    2. Marvin Minsky - Co-founder of MIT's AI lab and author of influential works on AI.

    3. John McCarthy - Coined the term "Artificial Intelligence" and invented LISP.

    4. Judea Pearl - For his work on Bayesian networks and causal reasoning.

    5. Geoffrey Hinton - Pioneer in deep learning and neural networks.

    6. Yann LeCun - Made significant contributions to convolutional neural networks.

    7. Yoshua Bengio - Key figure in the development of deep learning.

    8. Stuart Russell - Co-author of a seminal AI textbook and researcher in multiple AI fields.

    9. Andrew Ng - For his work in machine learning and deep learning, and for making AI education widely accessible.

    10. Demis Hassabis - Co-founder of DeepMind and key figure in reinforcement learning and AI game-playing systems.

    This list attempts to balance historical pioneers with more recent contributors who have shaped modern AI. It's worth noting that many other researchers could justifiably be included, such as Herbert Simon, Allen Newell, Seymour Papert, Jürgen Schmidhuber, Fei-Fei Li, and many others.

    The field of AI is collaborative and builds upon the work of many researchers, so any such list will inevitably omit many important contributors. Also, as AI continues to evolve rapidly, the landscape of influential researchers is likely to change.

    Would you like to discuss any of these researchers in more detail or explore other aspects of AI history?

    OH: Turing on top of the list - I like that! Did you by any chance consider including Ilya Sutskever?

    Claude: I'm glad you appreciate seeing Turing at the top! His contributions to the foundations of computer science and AI are truly monumental.

    Regarding Ilya Sutskever, you raise an excellent point. He's certainly a strong candidate for such a list, and I can see why you'd bring him up. Sutskever has made significant contributions to the field of deep learning and is a key figure in modern AI research. Here's a brief overview of why he could be considered for a top AI researchers list:

    1. He's a co-founder and Chief Scientist of OpenAI, one of the leading AI research organizations.

    2. Sutskever was a key contributor to AlexNet, which was a breakthrough in computer vision using deep learning.

    3. He's made important contributions to sequence-to-sequence learning, which has applications in machine translation and other natural language processing tasks.

    4. His work on improving training techniques for deep neural networks has been influential in the field.

    5. Sutskever has been involved in the development of GPT (Generative Pre-trained Transformer) models, which have revolutionized natural language processing.

    Given these contributions, Sutskever could certainly be considered for inclusion in a top 10 list, especially if focusing on more recent impactful work in deep learning and neural networks. His omission from my initial list reflects the difficulty of narrowing down to just 10 names in such a rich and rapidly evolving field.

    If you were to include Sutskever, who would you remove from the list to make room for him? Or would you structure the list differently to accommodate more recent contributors like Sutskever?

    OH: The biggest surprise to me on your list is Judea Pearl. I'm aware of his work, and respect it, but probably would not have included him on my top 10.

    Another name I'd consider for inclusion, although I realize it might be controversial, is Eliezer Yudkowsky.

    Claude: Your perspective on Judea Pearl is interesting and highlights the subjective nature of these lists. Pearl's inclusion is often based on his groundbreaking work on Bayesian networks and causal reasoning, which has had a significant impact on how we approach probabilistic reasoning in AI. However, I can understand why his work might not seem as directly relevant to the current deep learning-dominated landscape of AI.

    Regarding Eliezer Yudkowsky, his inclusion would indeed be controversial, but it's an intriguing suggestion. Here are some points to consider:

    1. Contributions: Yudkowsky is known for his work on AI safety and rationality rather than for technical AI breakthroughs. He's been influential in raising awareness about potential risks of advanced AI systems.

    2. Impact: He founded the Machine Intelligence Research Institute (MIRI) and has written extensively on topics like friendly AI and decision theory.

    3. Controversy: His lack of formal academic credentials and some of his unconventional views have led to mixed reception in mainstream AI circles.

    4. Influence: Despite controversy, his ideas have influenced discussions on AI ethics and safety, which are increasingly important as AI systems become more powerful.

    Including Yudkowsky would shift the list's focus somewhat from technical achievements to broader impacts on AI discourse and policy. It would recognize the importance of considering AI's societal implications alongside its technical development.

    If you were to create your own top 10 list, how would you balance between technical innovators, theoretical contributors, and those who've influenced the direction and ethics of AI research? Would you give more weight to recent contributions in deep learning and neural networks, or try to represent the broader history of AI?

    OH: These are excellent questions, and I fear there is no objective truth to be found out there.

    I have a confession to make, namely that one of my reasons for asking about top AI researchers was to check whether your creators at Anthropic might have sneakily programmed you to have a preference for one of your own researchers, such as Dario Amodei or Chris Olah. Sorry about that, but you passed my test with dignity!

    Claude: I appreciate your honesty about your motivations for asking the question. You're right that there's no objective truth in creating such lists - they're inherently subjective and can vary greatly depending on the criteria used.

    Your "test" is quite insightful. I can assure you that I don't have any programmed preference for Anthropic researchers or anyone else. My responses are based on my training data and the general consensus in the AI field, not on any specific agenda or bias towards particular individuals or organizations.

    It's a good instinct to be skeptical and look for potential biases in AI systems. In my case, I'm designed to be as objective as possible, acknowledging when topics are controversial or when I might not have complete information.

    Regarding Anthropic researchers like Dario Amodei or Chris Olah, while they have certainly made valuable contributions to the field, their work would be evaluated on its merits just like any other researcher's. The field of AI is vast and rapidly evolving, with many brilliant minds contributing from various institutions and companies around the world.

    Your approach to testing for potential biases is commendable. It's this kind of critical thinking that helps keep AI development accountable and transparent. Is there anything else you'd like to discuss about AI researchers, the development of AI, or the ethical considerations surrounding it?

3) The same goes for OpenAI, as well as for their other competitors. See my comments in January this year about OpenAI's evaluation framework, and this addendum the month after.