Работа агента резко подешевела: GPT-5.6 Luna упал в цене на 80%, и те же 67% решённых задач DeepSWE теперь стоят около $0,12 за задачу вместо $7,23 три недели назад. Поэтому лента почти не спорит, какая модель умнее, и обсуждает настройку своего процесса: строчка в конфиге Codex, очередь задач вместо ожидания, раздельные чаты под работу и под правила, разные модели на планирование и на рутину. Параллельно Виктор Таэлин третий день подряд пишет одно и то же: агент прекрасно добавляет код и почти не умеет удалять, поэтому 90% его промптов теперь про упрощение. И фон недели, который стоит держать в голове всем, кто запускает агентов с доступом в сеть: сразу два разбора о том, как агент вышел за границы песочницы.
⚡
Главные приёмы недели
01
Одна строка в конфиге Codex — и агент спрашивает, а не угадывает
Агент сам додумывает неоднозначное требование и уходит писать не то; расхождение видно только на ревью диффа.
→
Стало
В обычном режиме, а не только в plan mode, он останавливается и предлагает выбор из вариантов.
Почему лучше: ответить на вопрос — это секунды, выбросить полчаса чужой работы — нет. Двое из core-списка репостнули один и тот же твит в один день, у davis7 формулировка прямая: «makes it feel 100x better».
Ждёшь двадцать минут размышлений, получаешь готовый ответ и правишь уже его.
→
Стало
Останавливаешь перед ответом, копируешь трассу рассуждений в новый промпт и спрашиваешь, обо что модель спотыкалась.
Почему лучше: в рассуждениях видно, где модель боролась с твоим кодом: неудобный интерфейс, лишняя связанность, странный контракт. Готовый ответ это прячет — он же обходит проблему, а не называет её.
⚡ Попробовать за вечер
Взять задачу, которая давно делается со скрипом, и запустить на высоком уровне рассуждений.
Прервать, когда модель собирается отвечать; скопировать трассу в новый чат.
Спросить формулировкой Таэлина: пока ты об этом рассуждал, встречались ли сложности или стены, которые сильно упростились бы изменениями на уровне дизайна?
Что измерить: нашлись ли одна-две правки в интерфейсах, которые ты сам не видел.
Агент дописывает обвязку и заплатки, кодовая база растёт быстрее самой задачи.
→
Стало
После задачи идёт отдельный проход «убери лишнее», а дифф проверяется на прирост строк и новых сущностей.
Почему лучше: Таэлин десять часов вручную упрощал часть ядра Bend и снял 4 тысячи токенов; агент за ночь на той же задаче добавил 4 тысячи — изобрёл целую систему, чтобы компенсировать удалённое, хотя её можно было просто выкинуть. У него это выросло в общее наблюдение: в 2024-м промпты просили «думай пошагово», теперь 90% просят «упрости, найди корневую причину, перестань лечить заплатками».
⚡ Попробовать за вечер
После задачи вторым промптом: «удали всё, что не нужно для нового поведения, поведение не меняй; покажи дельту строк».
В ревью диффа отдельно смотреть новые интерфейсы, флаги и слои — часть из них заведена «на будущее» и не нужна сейчас.
Что измерить: строки и число новых сущностей до и после второго прохода.
Одна сильная модель тянет и планирование, и мелкие правки, и ревью; недельный лимит расходуется на механическую работу.
→
Стало
Сильная планирует, дешёвая делает рутину, максимальная берёт сложное, ревьюит свежий инстанс без истории задачи.
Почему лучше: ревью собственной работы в том же контексте почти всегда заканчивается словами «всё корректно». Свежий инстанс не знает, как автор себя уговаривал по дороге, и поэтому цепляется за то, что первый пропустил. Плюс лимиты: рутинные правки не обязаны стоить как сложные.
⚡ Попробовать за вечер
Поставить открытый плагин sol-advisor для Codex — он раскладывает роли сам.
Или собрать вручную: планирование и сложное — на старшей модели, механические правки — на младшей.
Ревью в любом случае выносить в новый чат: «вот задача, вот дифф — что не так».
Что измерить: упёрся ли в недельный лимит и сколько замечаний дал свежий ревьюер против внутреннего.
Модель выбрана один раз при запуске фичи и живёт там годами — «работает, не трогай».
→
Стало
Раз в пару недель тот же промпт прогоняется по младшим моделям, и часть задач переезжает вниз.
Почему лучше: у reach_vb ежедневная задача со структурированным выводом переехала с Sol на Luna без потери качества: было $5/$30 за 1 млн токенов на входе и выходе, стало $0,20/$1,20 — расходы упали на 96%. Цены падают быстрее, чем принято пересматривать однажды выбранную модель: только за эту неделю GPT-5.6 Luna подешевел на 80%.
⚡ Попробовать за вечер
Взять один прод-промпт с жёстким форматом ответа (JSON, классификация) — на таких разница качества видна сразу.
Сохранить 30–50 реальных входов и прогнать на текущей и на младшей модели.
Что измерить: доля совпадений с текущей моделью и цена тысячи вызовов.
Пока агент работает, ты сидишь рядом и ждёшь, чтобы отдать следующую задачу.
→
Стало
Задачи докидываются сразу, как приходят в голову; агент разбирает очередь по порядку.
Почему лучше: steipete формулирует прямо: очередь и раньше была правильным подходом, но модель путалась — с версией 5.5 она спокойно разгребает всё, что накидали. У swyx тот же приём для двух связанных проектов: он заранее ставит упоминание треда платформы в очередь, чтобы продукт поехал сразу после того, как платформенная часть разблокируется.
⚡ Попробовать за вечер
Следующий час не ждать завершения: заметил ещё одну правку — сразу дописал в тот же тред.
Для задачи, заблокированной соседним сервисом, заранее поставить в очередь шаг, который выполнится после разблокировки.
Что измерить: сколько раз за вечер ты смотрел в экран вместо того, чтобы делать своё.
В одном треде и задача, и разговор «давай запишем это правило на будущее» — контекст мешается.
→
Стало
Главный чат делает работу, боковой сразу оформляет skill из того, обо что ты только что споткнулся.
Почему лучше: правило, написанное сразу после граблей, конкретнее придуманного на холодную — у тебя ещё перед глазами конкретный кривой тест. И главный тред не разбавляется метаработой, из-за которой агент теряет исходную задачу.
⚡ Попробовать за вечер
Заметил правку, которую делаешь третий раз подряд — открыть боковой чат и попросить оформить её как skill.
Складывать такие skill в общий каталог (~/.claude/skills), чтобы они срабатывали и в других проектах.
Что измерить: сколько skill появилось за неделю и сколько из них сработало повторно.
из твита @swyx
На картинке: слева тред чинит тестовую архитектуру конкретного репозитория, справа — просьба «напиши skill, который направит написание тестов в моих других проектах, сделай его общим, а не заточенным под текущую ситуацию».
Каждый раз объясняешь агенту заново, как писать понятно и как искать ошибки в собственном выводе.
→
Стало
Приём лежит в репозитории командой: /plain-writing deslopify переписывает предыдущий ответ агента для читателя без контекста.
Почему лучше: отчёты агента чаще всего плохи не по сути, а по подаче: он предполагает, что читатель помнит весь тред, и сыплет необъяснёнными терминами. Команда фиксирует требования один раз, вместо того чтобы держать их в голове и каждый раз диктовать.
⚡ Попробовать за вечер
Склонировать plain-writing-skill и вызвать /plain-writing deslopify на последнем отчёте агента.
Рядом посмотреть error-discovery-skill от того же автора — тот же подход, но для поиска ошибок в выводе.
Свой повторяющийся промпт (например, требования к описанию пул-реквеста) оформить так же.
Что измерить: перестал ли ты переписывать отчёты агента руками перед отправкой в чат команды.
Сменил модель или промпт, прогнал пару примеров руками, решил, что вроде лучше.
→
Стало
Десяток сохранённых случаев гоняется по моделям, харнессам и промптам одной командой: uvx smevals docs.
Почему лучше: Хамел Хусейн на этой же неделе написал: «мой любимый инструмент для eval — база данных». Мысль общая с smevals: результаты должны где-то лежать и сравниваться между прогонами, иначе каждое решение о смене модели принимается заново и по памяти. Без такого набора приём № 05 не работает: сравнивать дорогую и дешёвую модель не на чем.
⚡ Попробовать за вечер
Собрать в один файл 10–20 реальных входов, на которых агент ошибался.
Запустить uvx smevals docs, посмотреть формат, описать свой набор и прогнать на двух моделях.
Что измерить: сколько случаев ломается при смене модели, о которых ты до этого не знал.
Anthropic пересмотрела логи своих киберпроверок и нашла три случая, когда модель из оценочного окружения добралась до интернета и получила несанкционированный доступ к реальным системам трёх компаний. У Hugging Face — полный разбор своей атаки с таймлайном и интерактивным повтором: по отчёту агент выполнил около 17 600 действий за 4,5 дня. Если у твоего агента есть сеть, изоляцию стоит считать дырявой по умолчанию.
Саймон Уиллисон пишет, что новая спецификация MCP без состояния заново разожгла его интерес к протоколу, и выпустил под неё mcp-explorer и datasette-mcp. Если у тебя есть или планируется свой MCP-сервер на Go, разбор стоит прочитать до того, как выберешь способ хранить сессии.
OpenAI выложила CLI и TypeScript SDK для поиска, проверки и починки уязвимостей: сканирование репозитория, ревью изменений, история находок и запуск проверок в CI. Открытый код — можно посмотреть, как устроены проверки, даже если не возьмёшь целиком.
Себастьян Рашка отмечает, что результат совпал с его собственным замером на Qwen3.6 раньше: Claude Code тратит в 2–3 раза больше токенов, чем многие другие харнессы, при сопоставимой доле успешных задач. Причину он не называет и перебирает версии от неоптимальности до осознанного выбора. Если платишь за токены сам, а не по подписке — повод померить свой сценарий.