#97 - "Inga bakdörrar – bara sidoingångar"

Betygsätt avsnittet

Bli först med att betygsätta

Om avsnittet

Publicerad
7 feb. 2026
Längd
2 h 4 min

#97 - "Inga bakdörrar – bara sidoingångar"

Generativet7 feb. 20262 h 4 min

Om avsnittet

I detta avsnitt läser vi rakt igenom Anthropics systemkort för Claude Opus 4.6 och ställer de obekväma frågorna: När slutar benchmarks bevisa säkerhet? Vad händer när en smartare modell blir bättre på att dölja sidouppgifter?

Varför vägrar den ofarligt innehåll oftare på vissa språk? Vi dyker ned i ARC‑AGI‑språnget, 1M+ tokens‑förståelse, webbagenter som skalar via kompaktering och multiagent‑orkestrering – och i den röriga verkligheten: GUI‑överagentik, prompt‑injektion, GitHub‑tokenfynd och “varuautomatsociopaten”. Med tolkningsverktyg (SAE, attributionsgrafer, aktiveringsorakel) tittar vi in i modellens “tankevärld” och hamnar till slut i diskussionen om främmande intelligens och AI‑välfärd.

Ett avsnitt för dig som bygger, granskar eller förlitar dig på frontier‑modeller – och vill veta vad som faktiskt händer under huven.

Kommentarer

0/1200 tecken

Kommentarer är anonyma och kräver inget konto. Håll god ton – uppenbar skräppost publiceras inte.

Inga kommentarer ännu. Bli först med att skriva något om avsnittet.

Fler avsnitt