Как Anthropic строит агентов, которые учатся на ошибках
Доклад с AI DevCon — спикер Lamis, инженер команды Anthropic, которая работает со стартапами и фаундерами на передовой применения ИИ.
Главная мысль
Модели становятся умнее с каждым релизом. Но в реальных продуктах один только интеллект модели не работает — нужна ещё память и контекст, который помогает агенту понимать задачу. Если этим заниматься, со временем возможности агентов умножаются.
Знакомая ситуация: агент не знает особенностей вашей кодовой базы, не помнит предпочтения пользователя и каждый раз делает ту же ошибку, что и в прошлый раз. Чтобы это исправить, Anthropic развивает контекст-инжиниринг — работу с памятью агентов.
Как Anthropic пришёл к нынешнему подходу
Сначала — простой текстовый файл с инструкциями. В начале сессии агенту давали markdown с парой строк о проекте и о том, как вы любите работать. Это работало на удивление хорошо, но при росте объёма файл начинал мешать.
Потом агентам дали автономию. Разрешили самим решать, когда читать и писать себе заметки по ходу работы. Это сработало.
Затем появились «навыки» (skills). Агент видит короткое описание навыка и подгружает детали только когда нужно. Как книжная полка: пробегаешь глазами корешки, достаёшь нужную книгу.
Сейчас — обычная файловая система. Агенты работают с markdown-файлами через стандартные инструменты (поиск, чтение). Никаких спецтулз — просто папки с файлами, которые можно индексировать и искать.
Что начинает ломаться при росте
- несколько агентов одновременно пишут в один файл;
- один агент меняет общую памятку, которую читают все остальные;
- заметки устаревают или в них попадают ошибки;
- иногда агенты «забывают», что правила изменились.
Как Anthropic решает это в продакшене
- Версионирование — каждая правка памяти фиксируется: кто, когда и на основе чего внёс изменение
- Защита от конфликтов — перед записью агент берёт «слепок» памяти, делает правку, и если за это время кто-то уже успел внести изменения — повторяет заново
- Права доступа — общие правила только для чтения, личные заметки агента — на запись
- Переносимость — память можно использовать в разных продуктах
Что это даёт
Со второго раза агент делает задачу лучше и быстрее. Тратит меньше токенов, потому что не разбирался с нуля. Разработчик может сфокусироваться на продукте, пока агенты сами учатся.
Парадигма dreaming — «сон агентов»
Отдельный фоновый процесс: пока агенты не работают, специальный «учитель» просматривает все их прошлые сессии, находит повторяющиеся ошибки и предлагает обновления памяти. Аналогия — завуч в школе: видит всю картину, корректирует учебный план.
Например, если все агенты путают радианы и градусы — dreaming добавит инструкцию о конфигурации. Если целая тема отсутствует в памяти — добавит. Если все делают одну и ту же ошибку — предложит общее правило.
Вывод
Минимум — начните с простого: текстовых файлов с инструкциями и навыками. Для долгих проектов — добавьте версионирование и права доступа. Чтобы агенты действительно становились умнее со временем — добавьте фоновый процесс «обзора и корректировки» памяти.