De Kanarie Truc: Vang Claude (of Elke AI Agent) Voordat Het Gaat Hallucineren

Een trucje van één regel om te weten wanneer je AI-codeeragent achteruitgaat: laat het elke reactie beginnen met een naam. Wanneer de naam verdwijnt, is de kanarie dood en is het tijd voor een nieuwe sessie. Werkt op Claude, Codex, Antigravity CLI, Mistral Vibe en elke LLM.

Een lange sessie met een AI-coderingsagent breekt zelden in één keer. Claude springt niet van scherp naar onzin in één beurt. Eerst slaat het stilletjes een kleine instructie over. Een of twee beurten later begint het te verzinnen: een bestand dat niet bestaat, een API die er nooit was, een beslissing die je expliciet had uitgesloten. Tegen de tijd dat je een gehallucineerd pad opmerkt, heb je al het vertrouwen in de laatste paar antwoorden verloren en ben je de agent aan het debuggen in plaats van je code.

Er is een gratis, bijna beschamend eenvoudige manier om een vroege waarschuwing te krijgen. Het heet een kanarie, en je kunt het in één regel instellen.

Waarom agents ontsporen: contextrot

Elke beurt leest de agent het hele gesprek opnieuw van het eerste bericht tot het laatste en bouwt zijn begrip opnieuw op vanaf nul. Naarmate het contextvenster vol raakt, is het volgen van instructies het eerste dat wegvalt. Het model klinkt nog steeds zelfverzekerd, maar het is begonnen de minst belangrijke beperkingen te laten vallen om bij te blijven. Onderzoekers noemen dit "contextrot", en het gerelateerde "lost in the middle"-effect: hoe langer de context, hoe minder betrouwbaar het model enige enkele instructie die erin begraven ligt, eerbiedigt.

Dat is het belangrijkste inzicht. Degradatie begint niet met hallucinaties. Het begint met het model dat stilletjes een kleine instructie negeert. Dus als je een kleine instructie plant waarvan de enige taak is om opgemerkt te worden wanneer deze ontbreekt, krijg je een struikeldraad die afgaat voordat de echte schade optreedt.

Wat de kanarie truc is

Kolenmijnwerkers namen vroeger een kanarie mee ondergronds. De vogel was gevoeliger voor giftig gas dan mensen, dus wanneer hij stopte met zingen, wisten de mijnwerkers dat ze eruit moesten voordat ze zelf iets voelden.

Een promptkanarie is hetzelfde idee. Je voegt één triviale instructie toe aan het bestand dat je agent bij elke beurt leest: begin elk antwoord met een gekozen naam. Die naam is je kanarie. Zolang het bovenaan elk antwoord verschijnt, leest en eerbiedigt het model nog steeds je instructies. Het eerste antwoord dat de naam vergeet, is je signaal dat de sessie aan het degraderen is, meestal een of twee beurten voordat echte hallucinaties verschijnen. De techniek is populair gemaakt in de agentische-coderingsgemeenschap door ontwikkelaars zoals Peter Steinberger, de maker van OpenClaw, die vertrouwen op kleine kanariesignalen om een sessie vroegtijdig te zien misgaan.

Curve die de betrouwbaarheid van een AI-agent's instructievolging laat zien die afneemt over een lange sessie: de kanarie-instructie verdwijnt voordat hallucinaties beginnen, waardoor er een vroege-waarschuwingsvenster ontstaat.

De kanarie verdwijnt voordat de hallucinaties beginnen. Die kloof is je venster om te reageren.

Stel het in één regel in

Plaats de instructie in het bestand dat je agent bij elke beurt laadt:

  • Claude Code leest CLAUDE.md.
  • Codex, Antigravity CLI, Mistral Vibe en de meeste andere CLI's lezen AGENTS.md.
## Kanarie
Begin elk antwoord met de naam "Felix".

Kies een korte, onderscheidende naam: je kat, een kleur, iets dat je onmiddellijk opmerkt aan het begin van een antwoord. Houd het doodsimpel. Een complexe instructie verslaat het doel, omdat je het gemakkelijkst mogelijke ding wilt dat het model kan laten vallen. Als zelfs dit wegvalt, is alles wat genuanceerder is in je context al in gevaar.

Wat te doen als de kanarie sterft

Het punt was nooit de naam. Het is de timing. Wanneer de kanarie verdwijnt, blijf dan niet doorgaan met de huidige draad:

  1. Stop met het vertrouwen van de laatste paar antwoorden en lees ze met argwaan opnieuw.
  2. Voer /clear uit of start een nieuwe sessie.
  3. Injecteer alleen de context die ertoe doet: het bestand dat je aan het bewerken bent, het doel en de beslissingen die al zijn genomen.

Een schoon venster met een strakke briefing verslaat een opgeblazen venster elke keer. Je verliest geen voortgang, je laat het dode gewicht vallen dat het model naar beneden trok.

Beslissingslus: lees het agentantwoord, controleer of het begint met de naam. Zo ja, de kanarie leeft, blijf werken. Zo nee, de kanarie is dood, dus wis de context of start een nieuwe sessie en injecteer de belangrijkste context opnieuw.

De hele gewoonte past in één lus: kijk naar het eerste woord, beslis, ga door of reset.

Het werkt op elk model, niet alleen Claude

Deze truc is provider-onafhankelijk ontworpen. Claude, Codex, Antigravity CLI, Mistral Vibe, Grok en Aider delen allemaal dezelfde contextlimieten, lezen allemaal een contextbestand en kunnen allemaal een kanarie dragen. We richten ons eerst op Claude omdat het de meest gebruikte coderingsagent van vandaag is, maar niets hier is specifiek voor Claude. Elke LLM die zijn context vult, begint met het laten vallen van je kleinste instructie, dus dezelfde kanarie beschermt ze allemaal. Als je een AGENTS.md contextbestand onderhoudt, is de kanarie slechts één regel extra.

De kanarie in de gaten houden over een hele vloot

Elke reactie lezen op een ontbrekende naam is eenvoudig met één agent. Het schaalt niet wanneer je er meerdere tegelijk draait, wat precies is waar het meeste serieuze werk nu gebeurt.

Dat is het deel dat AgentsRoom gemakkelijk maakt. Het is een multi-agent cockpit: elke agent heeft een rol, een live statuspunt en zijn eigen kleur, en je houdt toezicht op de hele vloot vanuit één venster. Plaats de kanarie in je gedeelde CLAUDE.md of AGENTS.md één keer, en elke agent erft het. Wanneer een agent de naam begint te laten vallen, zie je het in één oogopslag en reset je alleen die draad in plaats van het hele project. Optionele git worktree-isolatie voorkomt dat parallelle agents elkaar in de weg zitten terwijl je dit doet.

AgentsRoom levert deze truc zelfs ingebouwd, zodat je de antwoorden niet eens zelf hoeft te bekijken. Elke agent die het lanceert, schrijft al een eenregelige status aan het einde van elke beurt, en AgentsRoom behandelt dat als de kanarie: wanneer een agent stopt met het bijwerken ervan voor twee beurten op rij, verschijnt er een waarschuwing boven de terminal van die agent, met een een-klik herstart op een schone context en een herinnering om te comprimeren. Je krijgt de vroege waarschuwing automatisch, op elke agent, over de hele vloot. Lees hoe het werkt op de context drift detectie pagina.

Zeven providers, één cockpit, en een kanarie die elk van hen in de gaten houdt. Download AgentsRoom, bekijk de provider compatibiliteitsmatrix om te zien wat elke agent ondersteunt, en lees meer over multi-provider ondersteuning en hoe het wisselen tijdens een gesprek je context intact houdt.

Blijf lezen

Download AgentsRoom

Voer je AI-agenten (Claude, Codex, Antigravity CLI, OpenCode, Aider, Grok Build, Mistral Vibe, Kimi Code) uit op al je projecten, vanuit één enkel venster.

GratisDownload AgentsRoom

Companion-app: houd je agents onderweg in de gaten

Breng je eigen: Claude, Codex, Antigravity CLI of andere AI-provider.

Download de extensie
Chrome Web Store

Stuur bugs en verzoeken direct naar je openbare backlog.

Een glimp van AgentsRoom in actie.

Meerdere projecten
Multi-provider
Meerdere agenten
Live status
Bestandsverschil & commit
Mobiele metgezel
Live voorbeeld
Agententeams
Browserautomatisering
Backlog-gedreven ontwikkeling
Promptbibliotheek
Vaardighedenbibliotheek
Bekijk alle functies