Как Anthropic строит агентов, которые учатся на ошибках

Доклад с AI DevCon — спикер Lamis, инженер команды Anthropic, которая работает со стартапами и фаундерами на передовой применения ИИ.

🔗 Оригинал в X

Главная мысль

Модели становятся умнее с каждым релизом. Но в реальных продуктах один только интеллект модели не работает — нужна ещё память и контекст, который помогает агенту понимать задачу. Если этим заниматься, со временем возможности агентов умножаются.

Знакомая ситуация: агент не знает особенностей вашей кодовой базы, не помнит предпочтения пользователя и каждый раз делает ту же ошибку, что и в прошлый раз. Чтобы это исправить, Anthropic развивает контекст-инжиниринг — работу с памятью агентов.

Как Anthropic пришёл к нынешнему подходу

Сначала — простой текстовый файл с инструкциями. В начале сессии агенту давали markdown с парой строк о проекте и о том, как вы любите работать. Это работало на удивление хорошо, но при росте объёма файл начинал мешать.

Потом агентам дали автономию. Разрешили самим решать, когда читать и писать себе заметки по ходу работы. Это сработало.

Затем появились «навыки» (skills). Агент видит короткое описание навыка и подгружает детали только когда нужно. Как книжная полка: пробегаешь глазами корешки, достаёшь нужную книгу.

Сейчас — обычная файловая система. Агенты работают с markdown-файлами через стандартные инструменты (поиск, чтение). Никаких спецтулз — просто папки с файлами, которые можно индексировать и искать.

Что начинает ломаться при росте

  • несколько агентов одновременно пишут в один файл;
  • один агент меняет общую памятку, которую читают все остальные;
  • заметки устаревают или в них попадают ошибки;
  • иногда агенты «забывают», что правила изменились.

Как Anthropic решает это в продакшене

  • Версионирование — каждая правка памяти фиксируется: кто, когда и на основе чего внёс изменение
  • Защита от конфликтов — перед записью агент берёт «слепок» памяти, делает правку, и если за это время кто-то уже успел внести изменения — повторяет заново
  • Права доступа — общие правила только для чтения, личные заметки агента — на запись
  • Переносимость — память можно использовать в разных продуктах

Что это даёт

Со второго раза агент делает задачу лучше и быстрее. Тратит меньше токенов, потому что не разбирался с нуля. Разработчик может сфокусироваться на продукте, пока агенты сами учатся.

Парадигма dreaming — «сон агентов»

Отдельный фоновый процесс: пока агенты не работают, специальный «учитель» просматривает все их прошлые сессии, находит повторяющиеся ошибки и предлагает обновления памяти. Аналогия — завуч в школе: видит всю картину, корректирует учебный план.

Например, если все агенты путают радианы и градусы — dreaming добавит инструкцию о конфигурации. Если целая тема отсутствует в памяти — добавит. Если все делают одну и ту же ошибку — предложит общее правило.

Вывод

Минимум — начните с простого: текстовых файлов с инструкциями и навыками. Для долгих проектов — добавьте версионирование и права доступа. Чтобы агенты действительно становились умнее со временем — добавьте фоновый процесс «обзора и корректировки» памяти.