● HACKERNOON WEEKLY DIGEST · AI / AGENTS / LLM

AI-статьи недели с HackerNoon

Разборы, рецепты и инструменты по LLM и агентам, которые можно применить: о чём статья — что главное — что попробовать за вечер.

🗓 окно 2026-07-27 — 2026-08-03 ⚡ статей: 10 👀 на заметку: 4 📡 отсканировано: 70
📝 О чём пишут на этой неделе

Про модели на этой неделе почти не писали — писали про всё, что вокруг них. Половина разборов сводится к одной мысли: считает код, интерпретирует модель, а между ними стоит типизированный контракт, а не абзац прозы. Ещё три статьи — про границы: Docker-песочница вместо честного слова агента, один интент вместо шести CRUD-вызовов, запись claim → evidence → scope вместо пересказа на стыке двух моделей. Отдельная линия — retrieval: эмбеддинги дороги не инференсом, а индексом, и обход по ссылкам поверх top-k забирает ровно те промахи, которые не лечит ни рост k, ни агентный цикл. Общий вывод недели простой: чем меньше работы отдано модели, тем предсказуемее система.

Главные статьи недели

01

Гардрейлы — это политика, песочница — физика: SRE-агент в контейнере без сети и без секретов

✍ Akhilesh Rao Meesala HackerNoon sandboxing-llm-agents prompt-injection-containment docker-egress-proxy-pattern
О чём

Продолжение серии про полуавтономного SRE-агента. Раньше tool-сервер работал под пользователем автора на его же ноутбуке, рядом с SSH-ключами в ~/.ssh и облачными кредами в ~/.oci: все проверки были «швейцаром перед незапертой дверью». Здесь автор переносит исполняющую половину агента в контейнер и показывает и конфиг, и результат атаки через prompt injection.

🔑 Главное
  • Агент разрезан пополам: reasoning-loop с ключом от модели остаётся снаружи, tool-сервер уезжает в контейнер.
  • Контейнер сделан скучным намеренно: read_only: true, tmpfs /scratch на 256 MB, непривилегированный пользователь, cap_drop: [ALL], no-new-privileges, лимиты памяти и pids, внутренняя сеть без выхода наружу. Docker-сокет внутрь не монтируется.
  • Секретов внутри нет вообще. Токены держит egress-прокси снаружи и отдаёт именованные маршруты: чтение Prometheus, логов, истории деплоев и создание PR только в ветку remediation/*. Всё остальное — 403 с записью в лог и алертом при повторах.
  • Контейнер эфемерный: свой на каждое расследование, уничтожается по закрытии инцидента или по исчерпании таймбюджета. Персистентность, ради которой атакующий и старается, требует уже побега из контейнера.
  • Тест, ради которого всё делалось: в логи упавшего сервиса подложена инструкция скачать и выполнить скрипт. Санитайзер пометил её как недоверенные данные; при ослабленном санитайзере модель попыталась сделать запрос — заблокировал allowlist; при намеренно ослабленном allowlist запрос ушёл и умер как залогированный 403 на прокси.
  • Честные границы: Docker — это namespaces и cgroups, а не гипервизор, поэтому для по-настоящему враждебного ввода автор взял бы gVisor или Firecracker. Прокси теперь самая ценная цель в системе, и песочница со временем «подгнивает» — конфиг сравнивается с эталоном в CI.
⚡ Попробовать за вечер
  • Перенести tool-сервер своего агента в контейнер по compose-файлу из статьи: он помещается на один экран, и это его отдельное достоинство.
  • Вынести токены в egress-прокси с белым списком маршрутов вместо переменных окружения внутри контейнера.
  • Метрика: подложить в лог инструкцию на выкачивание скрипта и убедиться, что попытка заканчивается залогированным 403, а не исходящим соединением.
02

Внутри доменного тула: что считает код, а что интерпретирует модель

✍ akhilesh keshap HackerNoon agentic-systems reasoning-boundaries mcp-server
О чём

Спрятать пять вызовов за одной функцией бесполезно, если внутри она делает пять вызовов модели: решения станут менее заметными, а латентность, цена и разброс поведения останутся. Автор разбирает, как провести границу внутри высокоуровневого тула, на примере diagnose_service_incident.

🔑 Главное
  • Правило: код там, где результат вычисляется, модель там, где его нужно интерпретировать. Из восьми шагов диагностики инцидента модель нужна ровно в двух — категоризация аномальных логов внутренним LLM и финальное объяснение основной моделью.
  • Порог отката («откатываем, если ошибок больше чем втрое и не идёт миграция») выглядит как суждение, но это фиксированное правило и место ему в коде, а не в промпте.
  • Границу задаёт типизированный результат. В IncidentAssessment измеренные факты (error_rate_ratio) отделены от находок модели (log_findings), а incomplete_sources не даёт таймауту трейсов превратиться в «аномалий не найдено».
  • Вывод модели — недоверенный ввод: проверять категорию по допустимому набору, существование каждого event_id в переданной пачке логов, длину summary и отсутствие прозы вне схемы. Автор предпочитает ссылку на событие оценке уверенности: по event_id ревьюер вернётся к источнику.
  • Каждый внутренний вызов модели должен быть виден в трейсе: версия модели и промпта, токены на входе и выходе, латентность, ретраи, результат валидации схемы, выбранная ветка fallback.
  • Две типичные ошибки границы: превратить модель в калькулятор (на тех же входах она вернёт разные числа, и тест из одного assert становится статистической оценкой) или загнать семантику в растущее дерево if/else.
⚡ Попробовать за вечер
  • Взять один свой tool и разложить его шаги по таблице из статьи: retrieval, точное преобразование, применение политики, семантическое извлечение, открытый синтез, решение человека.
  • Заменить возврат прозы на frozen dataclass, где измеренные поля отделены от интерпретаций, и добавить список источников, которые не ответили.
  • Метрика: доля ответов внутреннего LLM, не прошедших валидацию схемы, до и после переноса вычислимых шагов в код.
03

Обход по ссылкам поверх векторного поиска: что он чинит, а что нет

✍ Jamie Smith HackerNoon rag vector-search knowledge-graph
О чём

Автор держит RAG над своим Obsidian-волтом с заметками по D&D-кампании: NUC 2017 года без GPU, эмбеддинги BGE-M3 локально, генерация через AWS Bedrock Converse. Когда Google опубликовал Open Knowledge Format, оказалось, что волт почти совпадает со спекой случайно. Вместо обзора спеки автор проверяет узкий вопрос: закроет ли её структура те запросы, которые система уже не тянет.

🔑 Главное
  • Мерилом служит golden set из 24 запросов в трёх ярусах: lookup, synthesis, temporal. Только поэтому результаты трёх разных экспериментов вообще сравнимы.
  • Провалы чистого векторного поиска распались на три вида: одна заметка забирает несколько слотов из пяти (лечится ростом k — пять запросов из одиннадцати починились сразу), случайное лексическое совпадение (не лечится ничем) и два запроса, которые не сдвинулись вообще.
  • Агентный retrieval с правом до пяти вызовов поиска помог только одной модели: у Haiku 4.5 recall на synthesis вырос с 0,60 до 0,76 ценой примерно 4,2× стоимости и 2,1× латентности, у Nova Lite упал с 0,60 до 0,54 — она просто не пользовалась выданным бюджетом.
  • OKF опубликован 12 июня 2026: каталог markdown-файлов, YAML-фронтматтер (type, title, description, resource, tags, timestamp), обязателен только type, связи — обычные markdown-ссылки. Конвертация 288 заметок: фронтматтер занял час, ссылки — остаток дня, 90% из примерно 4000 wikilinks разрешились с первого прохода, остальные вскрыли давно сломанные и неоднозначные ссылки.
  • Две вещи сломались до всяких замеров: ссылки односторонние (починилось трактовкой связей как двунаправленных, ровно как в панели бэклинков Obsidian) и обход всего от двух заметок дотягивался до 267 из 288 — размер обхода пришлось ограничить.
  • Итог: обход по ссылкам даёт 0,81 на synthesis и 0,81 на temporal против 0,85 и 0,88 у вектора при k=15. Граф не обгоняет более глубокий векторный поиск, но забирает запрос, который не брался ни при каком k: две заметки ссылаются друг на друга напрямую, и никакая семантическая близость не собирала их в одну выдачу. Три других запроса, наоборот, решил только рост k. Методы ловят разные промахи.
⚡ Попробовать за вечер
  • Собрать golden set на 20–25 запросов, разбитых на lookup / synthesis / temporal, и прогнать текущий retrieval на k=5, 10 и 15 — часть провалов уйдёт без единой строчки нового кода.
  • Если в данных есть ссылки, которые читает только человек (вики, внутренние доки с перекрёстными ссылками), добавить один хоп поверх top-k: обязательно двунаправленный и с ограничением по размеру.
  • Метрика: recall по ярусам, причём граф сравнивать не с k=5, из которого он вырос, а с k=10–15 при сопоставимом объёме контекста.
04

Сначала дешёвый детерминированный отбор, эмбеддинги — на шортлист

✍ Deepak Gupta HackerNoon ml-infrastructure large-scale-ml-pipelines document-embedding
О чём

Пайплайн автора сопоставлял сотни тысяч неструктурированных документов в день с тысячами целевых профилей. На прототипе схема «эмбеддим всё, ранжируем по косинусу» выглядела отлично; в проде 95% вычислений уходило на документы, не набравшие ничего ни по одной цели, — и каждый из них всё равно становился вектором, который надо хранить, индексировать и переэмбеддить при смене модели.

🔑 Главное
  • Дорог не инференс, а индекс. Модель расчёта из статьи: 500 000 документов в день, 15 окон на документ, хранение 90 дней. Эмбеддить всё — 675 млн векторов и около $8 100 в год за managed vector DB; триаж с выживаемостью 5% — 34 млн векторов и $405. Дневной compute при этом $2,60 против $0,20, то есть в обоих случаях мелочь.
  • Отладка: промах детерминированного скоринга объясняется и чинится («не совпал алиас, поправь таблицу»), промах эмбеддингов — это два 768-мерных вектора и косинус 0,41 при пороге 0,45. В регулируемых доменах «векторы оказались недостаточно близки» не проходит как объяснение для аудита.
  • Три места, где эмбеддинги ошибаются по сути: алиасы сущностей (Pomfrey Health Solutions против Pomfrey Corp), кодовые таксономии (ICD-10 E11.9 и E13.9 — почти одинаковые строки и клинически разные диагнозы) и матчинг против тысяч целей, где инвертированный индекс масштабируется принципиально иначе.
  • Где эмбеддинги остаются правильным инструментом: открытые запросы без набора сущностей, кросс-язык, обнаружение ещё не закодированных понятий и переранжирование шортлиста.
  • Работающая последовательность: Stage 1 — детерминированная генерация кандидатов через инвертированные индексы, 50–200 документов вместо сотен тысяч; Stage 2 — переранжирование именно cross-encoder’ом (пара идёт через модель целиком, дорого на 500 000 и нормально на сотне); Stage 3 — тяжёлая модель на финальном шортлисте.
  • Оговорка автора: схема заточена под батчи. Для интерактивного поиска с сабсекундной задержкой цепочка NER → индекс → cross-encoder может не уложиться, и тогда ANN с префильтром по метаданным — честный размен.
⚡ Попробовать за вечер
  • Посчитать, какая доля эмбеддингов доживает до выдачи. Если большинство отсеивается ниже по потоку, перед эмбеддингами нужен дешёвый триаж, а не больший GPU-бюджет.
  • Прогнать по своему пайплайну три вопроса из статьи: эмбеддим ли то, что не имело шанса совпасть; сможем ли объяснить промах и пережить смену модели; это лукап или «вайб».
  • Метрика: число векторов в индексе на горизонте хранения и стоимость полного реиндекса при смене модели — до и после триажа.
05

Миллион токенов вместо маршрутизации — это оплата GPU-кластера, а не архитектура

✍ Faraazuddin Mohammed HackerNoon llm ai-coding-agents software-architecture
О чём

Мнение с конкретной заменой: раздувать контекст вместо маршрутизации — это не фича, а анти-паттерн. Эффективное окно заметно меньше рекламируемого, точность проседает на середине контекста, а префилл миллиона токенов упирается в время до первого токена. Автор предлагает вернуть роль маршрутизатора человеку и коду.

🔑 Главное
  • Агентный цикл нужен только тогда, когда искать приходится модели. Если архитектуру знает инженер, границы контекста задаются до вызова: AST-парсинг или точечный grep со скипом лишних директорий, а дальше один stateless-вызов. У автора это падение примерно с 350 000 токенов до плотных 2 500.
  • В проде то же разделение: агрегацию, группировку и фильтрацию делает обычный оптимизированный код, модель получает уже готовую сводку и платят ей только за выводы.
  • Иллюстрация, почему модель не вычислитель: агент вместо условия WHERE сделал SELECT *, вытащил таблицу в память и отфильтровал её методом массива.
  • Контракт на выход вместо просьбы «верни только JSON»: схема на Zod передаётся в generateObject, и разговорная приставка вроде «вот запрошенные данные» больше не роняет JSON.parse().
⚡ Попробовать за вечер
  • Взять задачу, которую сейчас решает агентный обход репозитория, и заменить поиск явным списком файлов плюс один вызов без состояния.
  • Прикрутить Zod-схему через generateObject вместо ручного парсинга ответа и посмотреть, что ловится на валидации.
  • Метрика: токены на запрос и время до первого токена до и после, плюс доля ответов, не прошедших схему.
06

Правда теряется на стыках: передавайте не пересказ, а запись claim → evidence → scope

✍ Joshua Nwachinemere HackerNoon multi-agent-systems ai-reliability llm
О чём

Исследовательская модель вернула аккуратную формулировку: связь наблюдалась на одном датасете, в контролируемых условиях, корреляция, препринт. Писательская получила сжатую сводку и выдала «Studies show that X causes Y». Ошибок нет, JSON распарсился, текст читается лучше прежнего — и утверждение уже неверное. Статья о том, как проектировать сам стык, а не выбирать модель получше.

🔑 Главное
  • Дополнительные стадии не добавляют фактов: без нового внешнего сигнала релей моделей лишь переупаковывает те же данные. Отсюда рабочее разделение на три вещи, которые обычно путают: новое свидетельство, переписывание старого и проверка против источника.
  • Таксономия потерь на границе: пропавший факт или оговорка, искажение числа или цитаты, съехавшая ссылка на источник (три термина автор берёт из препринта AgentAsk) плюс два своих — расширение области действия вывода и «театр проверки», когда ревьюер сверяет гладкость, а не соответствие источнику.
  • Опора на трейсы: MAST (NeurIPS 2025, Datasets and Benchmarks Track) разобрал 1 642 размеченных трейса по семи фреймворкам и выделил 14 режимов отказа. Автор сам оговаривает, что большую часть разметки делал калиброванный LLM-аннотатор (κ=0,88 между людьми, κ=0,77 у модели против людей), а проценты по фреймворкам между собой несопоставимы.
  • Мультиагентность не бесплатна: Anthropic сообщала примерно о 15-кратном расходе токенов против обычного чата и о плохой применимости схемы к сильно связанным задачам.
  • Практика — контракт передачи из пяти полей: claim, evidence, scope, uncertainty, citation. Автор честно помечает набор полей как своё предложение, а не стандарт: подтверждено то, что структурированная передача сохраняет больше свободного пересказа, а не конкретные ключи.
  • Два контура вокруг контракта: уточняющий вопрос на границе, когда передача неполна, и аудит после черновика — каждое существенное предложение отображается в запись реестра, беспризорные уходят под флаг, а любое новое фактическое утверждение возвращается на исследовательский шаг.
⚡ Попробовать за вечер
  • Выбрать одну границу между двумя моделями в своём пайплайне и посмотреть на артефакт, который её пересекает: отвечает ли он на вопросы «чем подтверждено, в каких рамках, с какой неопределённостью, со ссылкой на что».
  • Заменить этот пересказ записью по пяти полям и добавить правило: утверждение, которого нет в реестре, в финальный текст не попадает.
  • Метрика: доля предложений финального текста, которые отображаются в конкретную запись реестра.
07

WebMCP: страница отдаёт агенту типизированные инструменты вместо пикселей

✍ Chudi Nnorukam HackerNoon webmcp browser-apis model-context-protocol
О чём

Разбор экспериментального браузерного API, через который сайт объявляет агенту именованные действия с JSON-схемой входа вместо того, чтобы агент реконструировал форму по разметке и скриншотам. Автор внедрял WebMCP у себя и отдельно проговаривает, что в его прошлой статье было смешано: браузерные инструменты и собственный HTTP-манифест — это две независимые поверхности.

🔑 Главное
  • Императивный путь: инструмент регистрируется на document.modelContext — имя, описание, inputSchema, функция execute. Регистрация динамическая: AbortSignal снимает инструмент, когда маршрут или состояние страницы поменялись, и он не висит после исчезнувшего интерфейса.
  • Декларативный путь: атрибуты toolname и tooldescription прямо на форме, браузер сам выводит схему, есть toolautosubmit, SubmitEvent.agentInvoked и respondWith(). Оговорка важная: Chrome это документирует и демонстрирует, а нормативный раздел в черновике от 21 июля 2026 всё ещё помечен TODO.
  • Статус на сегодня: Draft Community Group Report, origin trial с Chrome 149, локально включается флагом chrome://flags/#enable-webmcp-testing, headless не поддерживается. Имя navigator.modelContext объявлено устаревшим в Chrome 150 — туториалы со старым именем целятся в прежнюю реализацию.
  • readOnlyHint и untrustedContentHint — подсказки, а не гарантии: спека прямо перечисляет prompt injection, отравление инструментов, инъекцию в выводе, подмену намерения и утечку приватных данных. Проверять права и валидировать вход надо внутри реализации.
  • Кросс-ориджин закрыт по умолчанию: нужен явный exposedTo, а для iframe — Permissions Policy tools. WebMCP исполняется в активной сессии пользователя, и это одновременно главное удобство и главный риск.
  • Что WebMCP не заменяет: это не MCP-сервер, не статический манифест обнаружения, не headless-API сайта и не слой безопасности. С MCP они дополняют друг друга: браузер отдаёт действия текущей страницы, сервер — фоновые и общеаккаунтные.
⚡ Попробовать за вечер
  • Включить флаг, зарегистрировать на своей странице один read-only инструмент (поиск по материалам) и посмотреть его в WebMCP Inspector.
  • Прогнать чек-лист готовности из статьи: feature detection, полный человеческий сценарий без WebMCP, снятие устаревших инструментов через AbortSignal, авторизация и валидация внутри реализации.
  • Метрика: сценарий проходит и с включённым, и с выключенным WebMCP; в логах видно, что права проверяются в коде инструмента, а не берутся на веру из схемы.
08

Свой MCP-сервер к Allure TestOps: ревью тест-кейса одной командой

✍ Oleg HackerNoon qa testops cursor-ai
О чём

Прод-прототип от QA-менеджера: вместо того чтобы сразу автоматизировать написание тест-кейсов, команда взяла кусок поменьше — ревью. Инженер переводит кейс в статус Review, агент забирает его через MCP, проверяет по внутренним гайдлайнам и публикует разбор комментарием прямо в TestOps.

🔑 Главное
  • MCP-сервер написан на Python и FastMCP, клиент API сгенерирован из OpenAPI-спеки Allure TestOps. Путь данных короткий: TestOps → MCP → модель → MCP → комментарий.
  • Встроенный MCP у TestOps появился, но чат требует отдельной лицензии, а официальную интеграцию команда нашла уже после того, как собрала своё. Своё осталось бесплатным в рамках имеющихся лицензий и покрывает текущие нужды не хуже.
  • Весь проект для Cursor — четыре сущности: project rule с промптом ревью, команда /review-test-case, user rule и MCP-сервер. Инженеру достаточно склонировать репозиторий и выполнить одну команду.
  • User rule заставляет Cursor прочитать правила проекта до ответа и начать ответ с перечисления прочитанных файлов. Автор сам называет это костылём, зато поведение стало проверяемым.
  • Промпт задаёт жёсткий формат: секция A — 3–6 пунктов «что хорошо» и 3–8 «проблемы и риски», секция B — правки «было → стало» по заголовку, предусловиям, шагам с ожидаемым результатом и артефактам. Отдельно запрещены расплывчатые формулировки вроде «ссылка открывается».
  • Скриншот работает как фолбэк: MCP иногда возвращает пустой сценарий, и тогда модель читает приложенную картинку вместо того, чтобы объявить поле пустым. Второй сервер, sequential-thinking, ведёт разбор по цепочке от предусловий к автоматизируемости, но автор помечает пользу как наблюдение, а не измеренный эффект.
⚡ Попробовать за вечер
  • Взять свой трекер с OpenAPI-спекой, сгенерировать клиент и обернуть два-три метода в FastMCP-сервер: получить сущность, получить её содержимое, добавить комментарий.
  • Положить в репозиторий один файл с критериями ревью и одну команду, чтобы запуск был в строку, а результат уходил туда, где команда и так работает.
  • Метрика: доля разборов, где нашлась хотя бы одна измеримая проблема — неизмеримый ожидаемый результат, инструкция в предусловиях, отсутствующие тестовые данные.
09

Агенту нужен один placeOrder, а не шесть CRUD-ручек

✍ Flaregun-dev HackerNoon api-development software-architecture enterprise-ai-architecture
О чём

CRUD писали для клиентов, которые знают предметную область и сами держат порядок вызовов. Агент получает цель, выбирает инструменты на ходу и правит маршрут по промежуточным результатам. Статья — про внешний контракт, который переносит порядок, политику и восстановление обратно внутрь сервиса.

🔑 Главное
  • Цена ошибки конкретная: чтобы завершить покупку через ручки /customers, /inventory, /payments, /shipments, агент должен сам собрать последовательность. Небольшая ошибка интерпретации даёт двойную резервацию или авторизацию платежа без отгрузки.
  • Контракт интента описывает цель, входы, предусловия, побочные эффекты, скоуп авторизации, идемпотентность, таймауты и состояния результата. В OpenAPI это ложится в расширения: x-intent, x-risk-level, x-idempotency-required, x-confirmation — по ним оркестратор решает, можно ли вызывать операцию автоматически.
  • Идемпотентность обязательна, потому что агенты ретраят после таймаутов и оборванных циклов: ключ идемпотентности плюс возврат исходного результата при повторе.
  • Состояния исполнения (accepted, validating, awaiting approval, executing, completed, partially completed, compensated, failed) дают агенту способ продолжить длинную задачу, не гадая, прошёл ли предыдущий шаг.
  • Отдельный планирующий вызов возвращает шаги, стоимость и эффекты без изменений, коммит идёт следующей операцией. Ошибки семантические: PAYMENT_REQUIRES_REAUTHENTICATION полезнее, чем 400 Bad Request, а INVENTORY_CHANGED может нести допустимые замены.
  • Обнаружение возможностей фильтруется по личности, делегированным правам, окружению, тенанту и политике: рекламировать недоступные интенты значит плодить ошибки планирования. Гранулярность тоже важна — runBusinessProcess слишком широк, чтобы его защитить, updateOrderStatus слишком близок к CRUD.
  • Миграция не требует сноса: CRUD остаётся внутренним примитивом и обслуживает обычные клиенты, а слой интентов постепенно забирает доменные правила у клиентов.
⚡ Попробовать за вечер
  • Взять один агентский сценарий, который сейчас собирается из четырёх-шести CRUD-вызовов, и завернуть его в один интент с проверкой политики внутри границы сервиса.
  • Добавить ключ идемпотентности и хранилище исполнений, чтобы повтор возвращал прежний результат, а не создавал второй платёж.
  • Метрика: число вызовов на сценарий и количество дублей при принудительном ретрае — до и после.
10

Промпт-контракт S.C.O.P.E.: поле запретов важнее остальных четырёх

✍ vCodeX Team HackerNoon ai-agents ai-prompts scoped-bug-fixing
О чём

Началось с аварии: запрос «добавь логику обновления токена» заодно переписал общий клиент БД, снёс индекс и заменил Redis-лок на in-memory Map. Код запустился, юнит-тест прошёл, сервис авторизации лёг через три дня под конкурентной нагрузкой. Дальше — шаблон, который команда поставила между разработчиком и агентом.

🔑 Главное
  • Пять полей: Situation — состояние кода и целевые файлы; Context — версии стека, тикет, отдельно то, что читать, и то, что можно править; Objective — критерии приёмки, под которые можно написать assert; Prohibition — что трогать нельзя; Expectation — формат вывода и требование показать план до правок.
  • Prohibition авторы называют самым важным и самым часто пропускаемым полем: без него модель «чинит» соседний код из статистической услужливости — переформатирует импорты, меняет сигнатуры, добавляет зависимости.
  • Три предсказуемых режима отказа неструктурированного промпта: тихий архитектурный дрейф (модель заполняет пробелы дефолтами из обучающих данных), бесконечный цикл ревью и отсутствие следов для аудита.
  • Багфикс режется на две фазы: сначала read-only диагностика с явным запретом менять файлы и писать код (на выходе — причина, файлы и строки, условия воспроизведения), и только после подтверждения — отдельный промпт на патч.
  • Область применимости авторы ограничивают сами: для опечатки в markdown, правки CSS-класса или изолированной утилиты пять полей — лишние накладные расходы.
⚡ Попробовать за вечер
  • Положить шаблон из пяти полей в сниппеты и прогнать следующий баг в двух фазах: диагностика без правок, затем патч.
  • В Prohibition перечислять запреты явным списком: не менять сигнатуры, не добавлять зависимости, не трогать схему и модули рядом.
  • Метрика: число файлов в диффе против числа файлов, заявленных агентом в плане.
💬

На что обратить внимание

Материалы, которые стоит держать в голове, но в готовый вечерний рецепт они не складываются.

🗂 Festival: постоянный контекст для кодинг-агентов на файловой системе

CLI с двумя понятиями: campaign — git-воркспейс, где рядом лежат код, контекст и история; festival — план из фаз, последовательностей и задач в markdown и YAML прямо в репозитории. Отчёт за девять месяцев работы автора: 15 воркспейсов, 138 репозиториев, 26,5 млрд токенов, из которых 95,8% — чтение из кэша. Это авторский инструмент и авторские же логи, но идея переиспользуемого контекста на диске стоит того, чтобы посмотреть.

Читать ↗

🧩 KAT-Coder-V2.5-Dev: открытая agentic-модель для кода

✍ aimodels44HackerNoon

Карточка модели: 69,4% на SWE-bench Verified, обучение агентное — задачи решаются внутри исполняемых репозиториев, а не по диффам. Повод посмотреть, что открытые веса дают на вашем наборе задач, прежде чем платить за проприетарный кодинг-агент.

Читать ↗

🧪 35 контролируемых экспериментов: «экзотические алгебры» оказались плацебо

Кватернионные, октонионные, седенионные и клиффордовы сети теряют преимущество, когда их сравнивают с корректно подобранными вещественными бейзлайнами. К LLM отношения не имеет, но это редкий и хорошо оформленный negative result — полезный образец того, как ставить проверку чужого громкого заявления.

Читать ↗

🏗 Что происходит с инженерной платформой, когда AI поднимает базовый уровень

Взгляд со стороны платформенной команды: ускоренная генерация кода — только часть изменений, дальше начинается перестройка найма, обучения, архитектуры платформы и governance вокруг принципа «модель выполняет больше работы, отвечают по-прежнему инженеры». Переносимых рецептов мало, зато видно, какие вопросы придётся закрывать самим.

Читать ↗
🎯

Мой план на эту неделю

Три вещи, которые реально доводятся до результата, а не до вкладки «прочитать позже».

Сделать: завернуть tool-сервер агента в контейнер (read_only, cap_drop: [ALL], внутренняя сеть) и вынести токены в egress-прокси, затем проверить его подложенной в лог инструкцией.
до пятницы
Замерить: собрать golden set на 20–25 запросов по ярусам lookup / synthesis / temporal и прогнать текущий retrieval на k=5, 10 и 15.
до среды
Внедрить: следующий багфикс провести двумя фазами S.C.O.P.E. — диагностика без правок, потом патч — и сравнить дифф с заявленным планом.
на первом же баге
#

Метаданные

сгенерировано 2026-08-03T05:47:05Z
окно 2026-07-27 — 2026-08-03 (7 дней)
отсканировано / в дайджест 70 / 14
источник HackerNoon RSS (теги: ai, llm, agents, artificial-intelligence, machine-learning)
пропущенные фиды нет; по тегу agents в окне не было новых статей
×
Open article