roko.fans четверг, 8 октября 2026

Автор The New Stack пересмотрел свою модель проверки AI-кода и добавил в неё слой «Debate»

Автор The New Stack, полгода назад предложивший отказаться от построчного чтения AI-диффов, признал ошибку. По его словам, ошибочной оказалась не сама идея, а то, чем он предлагал заменить такое ревью. «Я по-прежнему думаю, что построчное ревью уходит», — написал он.[1][2]

Объекты:

Исходная модель называлась «Swiss cheese» и состояла из пяти слоёв доверия. В обновлённой версии появился слой «Debate», которого раньше не было. Ещё один слой, «Argue», предполагает, что агенты спорят до создания PR, пока сменить курс дешевле всего. Общий принцип автор сформулировал так: строить инструменты для того, что AI делает хорошо, и защищать то, чего он делать не может.[1][3][4][5]

В доводах автор опирается на исследования. В 2013 году Альберто Баккелли и Кристиан Берд разобрали 570 комментариев к ревью кода в Microsoft: 44% разработчиков назвали поиск дефектов главной целью ревью, но дефектов касались лишь 14% комментариев. Пять лет спустя Кейтлин Садовски с коллегами изучили девять миллионов изменений в Google и пришли к тому же выводу.[6][7][8]

Свежие данные тоже приводятся. В отчёте Faros AI за 2026 год, охватившем 22 000 разработчиков из более чем 4 000 команд, число инцидентов на PR выросло на 242,7%, багов на разработчика стало больше на 54%. Количество PR, слитых вообще без ревью, выросло на 31,3%. DORA пишет, что внедрение AI одновременно повышает и скорость, и нестабильность доставки. Гергей Орош заметил, что разработчики, которые проверяют код с прежним усердием, перегружены «AI slop» PR. «Писать стало дёшево, а понимать осталось так же дорого, как всегда», — сказал Адди Османи.[9][10][11][12][13]

Текст составлен ИИ по материалам ниже и не содержит фактов, которых нет в источниках.

  1. 1 The New Stack — Kill the code review theater, keep the review ↗ 30 сентября, 17:00 · сноски 1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11, 12, 13 The New Stack — OpenAI’s always-on agents are free, until one specific thing happens ↗ 2 октября, 01:00 The New Stack — OpenAI’s Dots boundary problem rate doubled in longer tests ↗ 30 сентября, 18:26 The New Stack — Developers are secretly hoping OpenAI fails to ship this month ↗ 6 октября, 00:49
  1. 2 InfoWorld — OpenAI bets enterprises are ready to delegate real work to autonomous agents ↗ 1 октября, 03:24
  2. 3 MarkTechPost — Meta, OpenAI and Uber Just Taught AI Agents to Talk First. What About When to Stay Quiet? ↗ 3 октября, 10:05 MarkTechPost — Can an Open Model Do Security Research? Cantina’s apex-flash-1 Solves 40 of 60 Held-Out Bug Tasks ↗ 5 октября, 04:47 MarkTechPost — Meet Together Link: A Free CLI That Runs Open Models Like Kimi K3 and GLM 5.3 Inside Claude Code, Codex, and OpenCode ↗ 6 октября, 01:51
  3. 4 Latent Space — [AINews] not much happened today ↗ 3 октября, 11:45
  4. 5 Tom's Hardware — ChatGPT-6 Astra plays World of Warcraft 'blind' and clears the orc starting zone in 40 minutes with no deaths ↗ 3 октября, 13:00
  5. 6 404 Media — Meta Rushed to Fix Muse ‘VM Escape' Vulnerability Immediately Before Launch ↗ 5 октября, 17:13 404 Media — Muse escapes containment ↗ 5 октября, 18:38

Запись полезная?

Войдите, чтобы ответить

Anthropic выпустила Claude Haiku 5.5 по цене $0,10 за миллион входных токенов