Як зменшити витрати на токени Claude Code без уповільнення роботи
Claude Code стягує плату за кожен токен, і більшість витрат є невидимими: роздутий контекст, неправильна модель, необроблені PDF, агенти, які перечитують ті самі файли. Ось куди насправді йдуть гроші і як їх зменшити, з звичками та інструментами, які зберігають ваш рахунок низьким без уповільнення роботи.
Claude Code стягує плату за токени, і рахунок підкрадається непомітно. Не через код, який він пише, ця частина дешева. Гроші йдуть на все, що модель перечитує на кожному кроці: вікно контексту, заповнене старими повідомленнями, різниця у 40 файлах, яку ніхто не просив, PDF, тихо перетворений на зображення, той самий CLAUDE.md, відправлений сотню разів на день.
Ось куди насправді йдуть токени, і як витрачати їх менше без погіршення якості коду або затримок.
Спочатку подивіться на лічильник
Ви не можете скоротити те, чого не бачите. Перш ніж щось змінювати, дізнайтеся, скільки насправді коштує сесія.
Кожне повідомлення, яке ви надсилаєте, повторно надсилає всю розмову до цього моменту. Хід 30 - це не один запит, це тридцять запитів, складених один на одного, плюс кожен файл, який агент прочитав на шляху. Ось чому довга сесія стає дорогою ближче до кінця, навіть якщо ваше останнє питання було однією лінією.
У AgentsRoom ви можете спостерігати це в реальному часі за допомогою перегляду використання токенів Claude Code: поточний підрахунок токенів і вартість поточної сесії прямо в інтерфейсі, щоб ви перестали гадати. Збільшіть масштаб до панелі статистики проекту і ви побачите вартість за проект, за агента і за день. Як тільки ви зможете бачити, як число зростає, виправлення нижче перестануть бути абстрактними.
Тримайте вікно контексту щільним
Найбільший важіль - це розмір контексту. Надмірне вікно - це податок, який ви платите на кожному кроці до кінця сесії.
Починайте нову сесію, коли змінюєте завдання. Не налагоджуйте конфігурацію webpack в тій самій гілці, де ви щойно рефакторили авторизацію. Виконайте /clear і почніть з чистого аркуша. Старі повідомлення не допомагали новому завданню, вони просто їхали разом з рахунком.
Слідкуйте за повільним дрейфом теж. Довгі сесії не тільки стають дорогими, вони стають дурнішими: модель починає втрачати сюжет, повторюватися, забувати, що вирішила двадцять повідомлень тому. AgentsRoom має детектор дрейфу контексту, який попереджає вас, коли агент деградує, що зазвичай є точним моментом для стиснення або перезапуску. Ми описали трюк за цим у методі канарки для виявлення деградації агента. Коротші сесії дешевші і гостріші одночасно.
Перестаньте годувати його сирими PDF
Це майже безкоштовні гроші. Коли ви кидаєте PDF у Claude, кожна сторінка також перетворюється на зображення, і візуальні токени коштують набагато більше, ніж текст. Специфікація на 20 сторінок може спалити десятки тисяч токенів, перш ніж ваше питання навіть буде прочитано.
Спочатку перетворіть файл у Markdown. Одна команда з безкоштовним інструментом знижує вартість до 80%, і модель відповідає так само добре, часто краще, тому що вона читає чисту структуру замість того, щоб примружуватися на зображення сторінок. Повний посібник тут: перетворити PDF у Markdown, щоб заощадити токени. Перетворіть один раз, закомітьте .md у репозиторій, і кожен майбутній крок читає дешевий текст.
Використовуйте найдешевшу модель, яка може виконати завдання
Opus для всього - це як рахунки вибухають. Перейменування змінної, написання повідомлення коміту або виправлення помилки не потребує вашої найдорожчої моделі. Менша модель робить це за частку ціни, і ви не відчуєте різниці.
Звичка проста: підбирайте модель під завдання. Важка архітектурна робота отримує велику модель, механічні правки - маленьку. Adaptive Mode в AgentsRoom робить це автоматично, пропонуючи найдешевшу здатну модель для того, що ви насправді робите, щоб ви перестали платити преміальні ставки за рутинну роботу.
Делегуйте рутинну роботу дешевшому агенту
Деякі завдання великі, але поверхневі: написання тестів для модуля, перевірка сотні файлів на шаблон, генерація шаблонного коду. Ви не хочете, щоб ваш дорогий агент перемелював усе це в одному гігантському контексті.
Нехай він передасть завдання. З делегуванням агентів агент-розробник може передати підзавдання другому агенту, що працює на дешевшій моделі, який виконує повторювану роботу у своєму чистому контексті і звітує назад. Дорогий агент залишається зосередженим і маленьким, дешевий агент з'їдає обсяг. Ваш рахунок слідує за розподілом.
Перестаньте пояснювати себе знову
Якщо ви вводите один і той самий трьохабзацний запит щоразу, коли починаєте код-рев'ю, ви платите за його відправку щоразу. Збережіть його один раз.
Зберігайте свої повторювані інструкції в бібліотеці запитів і свої повторювані процедури як навички, які агент завантажує лише тоді, коли вони потрібні. Ви повторно використовуєте формулювання замість того, щоб переписувати і повторно відправляти його, і навичка тримає свої детальні кроки поза базовим контекстом до моменту, коли вони дійсно потрібні. Той самий результат, менше токенів переміщено.
Слідкуйте за вартістю запуску агентів паралельно
Паралельні агенти - це суперсила, і вони множать ваші витрати на токени рівно на кількість агентів, яких ви запускаєте. П'ять агентів, що читають один і той самий спільний контекст, - це п'ять разів більше читань.
Це нормально, поки ви можете це бачити. Тримайте статистику проекту відкритою, коли ви масштабуєте, направляйте своїх агентів на легкі .md посилання замість сирих документів, і вбивайте тих, які закінчили, замість того, щоб залишати їх простоювати в дорогому вікні. Паралелізм повинен купувати вам швидкість, а не несподіваний рахунок. Якщо ви запускаєте кодуючих агентів паралельно, спільний, перетворений контекст тримає всю флотилію доступною.
Коротка версія
Більшість вашого рахунку за Claude Code - це не код, це перечитування. Отже:
- Слідкуйте за живим лічильником токенів, щоб число ніколи не було сюрпризом.
- Виконуйте
/clearміж завданнями і тримайте сесії короткими. - Перетворюйте PDF у Markdown перед тим, як запитувати.
- Використовуйте найменшу модель, яка може виконати завдання, або дайте Adaptive Mode вибрати її для вас.
- Делегуйте поверхневу, великооб'ємну роботу дешевшому агенту.
- Повторно використовуйте запити і навички замість того, щоб переписувати їх.
Нічого з цього не уповільнює вас. Коротший контекст і правильна модель зазвичай роблять агента швидшим і гострішим, а дешевший рахунок - це бонус.
Ці шість звичок: це витратна частина наших 50 порад Claude Code. Решта списку охоплює підказки, хуки, субагентів і CLAUDE.md.
Хочете лічильник, маршрутизацію моделі і делегування в одному місці? Завантажте AgentsRoom і спостерігайте, як ваші витрати на токени знижуються у перегляді використання токенів.
Завантажити AgentsRoom
Запускайте всіх своїх AI-агентів на всіх своїх проєктах з одного вікна.
Додаток-компаньйон: контролюйте своїх агентів на ходу
Використовуйте свого: Claude, Codex, Antigravity CLI або іншого AI-провайдера.
Надсилайте баги та запити прямо у свій публічний беклог.
Читати далі
Десять агентів запустили ту саму перевірку типів водночас. Розв'язком виявилася тека.
Сімнадцять кодових агентів в одному чекауті, десять процесів tsc паралельно, load average 37 і 87 МБ вільної пам'яті. Перевірка типів на дев'яносто секунд забрала 7 хв 36. Ось виміри, пояснення того, чому машина не рахувала, і маленьке спільне блокування, яке все виправило. Копіюється в будь-який репозиторій.
Читати статтюМій ШІ-тренер з бігу: репозиторій Git і агент Claude
Я закінчую пробіжку, годинник синхронізується, і через три хвилини аналіз уже записаний у мій репозиторій, тиждень перебудовано, а тренер залишив коментар під активністю в Strava. Жодного написаного застосунку, жодного сервера, жодного рахунку за токени: підписка Claude, AgentsRoom і файли Markdown. Ось уся збірка, яку можна повторити.
Читати статтюЗабагато терміналів, забагато AI-агентів: когнітивний борг, що уповільнює вас (і як з нього вибратися)
Жонглювання десятьма терміналами AI-агентів створює когнітивний, документаційний та фінансовий борг, що коштує вам часу та токенів. Ось як повернути контроль.
Читати статтю