Игорь Цупко опубликовал на Хабре статью о внутреннем устройстве агентных систем. Главный совет он вынес в начало: «Мой главный совет звучит резко: не начинайте с разработки собственного ядра агента».[1]
Совет основан на личном опыте автора. По его словам, он написал много кода, который писать не следовало, и наткнулся на подводные камни, о которых по простому демо не догадаешься. Статья выросла из его доклада о том, как устроены агентные системы.[2][3]
Цупко разбирает, из каких частей складывается агентная система и почему каждая из них превращается в отдельный проект. Реализации у Codex, Claude Code, OpenCode и других различаются, но основные инженерные задачи, как пишет автор, удивительно похожи.[4][5]
В тот же день телеграм-канал @ai_machinelearning_big_data сообщил, что Google AI Research и Кембриджский университет открыли код VeriHarness. Эта система проверяет результаты долгих агентных задач силами той же модели, которая их выполнила. Протокол работает внутри Gemini CLI, Claude Code и Codex.[6][7]
Проверка идёт в отдельных контекстах модели. Первый из них, как пишет канал, разбирает утверждения, в которых прогоны расходятся, и подбирает проверку, которая лучше всего отделит верный вариант. По данным канала, VeriHarness с правками поднял средний результат по сравнению с одиночным прогоном с 47,2 до 53,4 балла у Gemini 3.5 Flash и с 49,6 до 56,1 у Claude Opus 4.8. Вместе с кодом авторы выложили около 26 тысяч трейсов агентов, на генерацию которых ушло больше 100 тысяч долларов.[8][9][10]
В этой статье разберу, из каких частей на самом деле складывается агентная система, почему каждая из них превращается в отдельный проект и где стоит приложить собственные усилия.
Google AI Research и Кембриджский университет открыли код VeriHarness, системы, которая проверяет результаты долгих агентных задач силами той же модели, что их сделала.
VeriHarness с правками поднял средний результат по сравнению с одиночным прогоном с 47,2 до 53,4 балла у Gemini 3.5 Flash и с 49,6 до 56,1 у Claude Opus 4.8.