Трюк з канаркою: зловіть Claude (або будь-якого AI агента) до того, як він почне галюцинувати

Однолінійний трюк, щоб знати, коли ваш AI агент для кодування погіршується: змусьте його починати кожну відповідь з імені. Коли ім'я зникає, канарка мертва, і настав час для нової сесії. Працює на Claude, Codex, Antigravity CLI, Mistral Vibe та кожному LLM.

Довга сесія з AI-агентом для кодування рідко ламається одразу. Claude не переходить від чіткого до безглуздого за один хід. Спочатку він тихо пропускає невелику інструкцію. Через хід або два він починає вигадувати: файл, якого не існує, API, якого ніколи не було, рішення, яке ви явно виключили. До того часу, як ви помічаєте галюцинований шлях, ви вже втратили довіру до останніх кількох відповідей і відлагоджуєте агента замість свого коду.

Існує безкоштовний, майже соромливо простий спосіб отримати раннє попередження. Це називається канарка, і ви можете налаштувати її за один рядок.

Чому агенти сходять з рейок: гниття контексту

Кожен хід агент перечитує всю розмову від першого повідомлення до останнього і відновлює своє розуміння з нуля. Коли вікно контексту заповнюється, перше, що починає прослизати, - це слідування інструкціям. Модель все ще звучить впевнено, але вона почала відкидати найменш важливі обмеження, щоб встигати. Дослідники називають це "гниттям контексту" і пов'язаним з цим ефектом "втрата в середині": чим довший контекст, тим менш надійно модель дотримується будь-якої окремої інструкції, захованої всередині нього.

Це ключове розуміння. Деградація не починається з галюцинацій. Вона починається з того, що модель тихо ігнорує невелику інструкцію. Тому, якщо ви вставите невелику інструкцію, яка має єдине завдання - бути поміченою, коли вона зникає, ви отримаєте сигнальну нитку, яка спрацьовує до справжньої шкоди.

Що таке трюк з канаркою

Шахтарі колись носили канарку під землю. Птах був більш чутливий до токсичного газу, ніж люди, тому, коли він переставав співати, шахтарі знали, що треба виходити задовго до того, як вони самі щось відчували.

Підказка-канарка - це та ж ідея. Ви додаєте одну тривіальну інструкцію до файлу, який ваш агент читає на кожному ході: починати кожну відповідь з обраного імені. Це ім'я - ваша канарка. Поки воно з'являється на початку кожної відповіді, модель все ще читає і дотримується ваших інструкцій. Перша відповідь, яка забуває ім'я, є вашим сигналом, що сесія деградує, зазвичай за хід або два до появи справжніх галюцинацій. Цю техніку популяризували в спільноті агентного кодування розробники, такі як Пітер Штайнбергер, творець OpenClaw, які покладаються на невеликі сигнали-канарки, щоб рано виявити, що сесія йде не так.

Крива, що показує зниження надійності слідування інструкціям AI-агента протягом довгої сесії: інструкція-канарка зникає перед початком галюцинацій, залишаючи вікно раннього попередження.

Канарка зникає перед початком галюцинацій. Цей проміжок - ваше вікно для реакції.

Налаштуйте це за один рядок

Вставте інструкцію у файл, який ваш агент завантажує на кожному ході:

  • Claude Code читає CLAUDE.md.
  • Codex, Antigravity CLI, Mistral Vibe та більшість інших CLI читають AGENTS.md.
## Canary
Починайте кожну відповідь з імені "Felix".

Виберіть будь-яке коротке, виразне ім'я: вашого кота, колір, щось, що ви миттєво помітите на початку відповіді. Залиште це максимально простим. Складна інструкція зводить нанівець мету, тому що ви хочете, щоб модель відкинула найпростіше. Якщо навіть це зникає, все більш нюансоване у вашому контексті вже під загрозою.

Що робити, коли канарка вмирає

Суть була не в імені. Вона в часі. Коли канарка зникає, не продовжуйте поточну нитку:

  1. Перестаньте довіряти останнім кільком відповідям і перечитайте їх з підозрою.
  2. Виконайте /clear або почніть нову сесію.
  3. Повторно введіть лише той контекст, який має значення: файл, який ви редагуєте, мету та вже прийняті рішення.

Чисте вікно з чітким завданням завжди краще за перевантажене. Ви не втрачаєте прогрес, ви відкидаєте мертвий вантаж, який тягнув модель вниз.

Цикл прийняття рішень: прочитайте відповідь агента, перевірте, чи починається вона з імені. Якщо так, канарка жива, продовжуйте працювати. Якщо ні, канарка мертва, тому очистіть контекст або почніть нову сесію і повторно введіть ключовий контекст.

Вся звичка вміщується в один цикл: погляньте на перше слово, вирішіть, продовжуйте або скидайте.

Це працює на кожній моделі, не тільки на Claude

Цей трюк за задумом не залежить від постачальника. Claude, Codex, Antigravity CLI, Mistral Vibe, Grok і Aider всі мають однакові обмеження контексту, всі читають контекстний файл, і всі можуть нести канарку. Ми зосереджуємося на Claude спочатку, тому що це найбільш використовуваний агент для кодування сьогодні, але тут немає нічого специфічного для Claude. Будь-яка LLM, яка заповнює свій контекст, почне з відкидання вашої найменшої інструкції, тому та ж канарка захищає кожну з них. Якщо ви підтримуєте контекстний файл AGENTS.md, канарка - це просто ще один рядок у ньому.

Спостереження за канаркою у всьому флоті

Читати кожну відповідь на відсутність імені легко з одним агентом. Це не масштабується, коли ви запускаєте кілька одночасно, що саме і відбувається зараз у більшості серйозних робіт.

Це та частина, яку AgentsRoom робить легкою. Це багатопрофільний кокпіт: кожен агент має роль, живу точку статусу та свій колір, і ви контролюєте весь флот з одного вікна. Вставте канарку у ваш спільний CLAUDE.md або AGENTS.md один раз, і кожен агент успадковує її. Коли один агент починає відкидати ім'я, ви помічаєте це з першого погляду і скидаєте лише ту нитку, а не весь проект. Опціональна ізоляція git worktree запобігає перетинанню паралельних агентів, поки ви це робите.

AgentsRoom фактично постачає цей трюк вбудованим, тому вам навіть не потрібно самостійно стежити за відповідями. Кожен агент, який він запускає, вже записує однорядковий статус в кінці кожного ходу, і AgentsRoom розглядає це як канарку: коли агент перестає оновлювати його протягом двох ходів поспіль, над терміналом цього агента з'являється попередження з можливістю перезапуску на чистому контексті і нагадуванням про компактність. Ви отримуєте раннє попередження автоматично, на кожному агенті, по всьому флоту. Прочитайте, як це працює на сторінці виявлення дрейфу контексту.

Сім постачальників, один кокпіт, і канарка, що стежить за кожним з них. Завантажте AgentsRoom, перевірте матрицю сумісності постачальників, щоб побачити, що підтримує кожен агент, і дізнайтеся більше про підтримку кількох постачальників і як перемикання під час розмови зберігає ваш контекст неушкодженим.

Продовжити читання

Завантажити AgentsRoom

Запускайте свої AI-агенти (Claude, Codex, Antigravity CLI, OpenCode, Aider, Grok Build, Mistral Vibe, Kimi Code) на всіх ваших проєктах з одного вікна.

БезкоштовноЗавантажити AgentsRoom

Додаток-компаньйон: контролюйте своїх агентів на ходу

Використовуйте свого: Claude, Codex, Antigravity CLI або іншого AI-провайдера.

Отримати розширення
Chrome Web Store

Надсилайте баги та запити прямо у свій публічний беклог.

Погляд на AgentsRoom в дії.

Кілька проектів
Багато постачальників
Кілька агентів
Статус в реальному часі
Різниця файлів і коміт
Мобільний компаньйон
Попередній перегляд в реальному часі
Команди агентів
Автоматизація браузера
Розробка, орієнтована на беклог
Бібліотека підказок
Бібліотека навичок
Переглянути всі функції