roko.fans четверг, 8 октября 2026

Дженнифер Невилл из Microsoft Research строит оценки AI под реальные задачи пользователей

По словам Дженнифер Невилл, ML- и AI-специалисты обычно оценивают системы по бенчмаркам, и эти тесты заметно проще того, как люди пользуются AI на практике. «Поэтому мы и сосредоточены на оценке», — сказала она в беседе, которую опубликовал Microsoft Research Blog.[1]

Объекты:

Невилл работает партнёр-менеджером по исследованиям в Microsoft. Блог компании пишет, что вся её карьера связана с тем, чтобы понимать и развивать AI для реального применения. Её собеседник Чед Аталла работает главным прикладным учёным в Microsoft Research. В компании он чуть больше шести лет и большую часть этого времени занимается оценкой AI.[2][3]

Команда Невилл называется AI Interaction and Learning team. По её словам, команда старается продвинуть поведение AI-систем в реалистичных рабочих средах.[4]

Для этого команда строит оценки, близкие к реальной работе. Невилл перечислила, что в них входит: многоходовое поведение, совместные среды и долгосрочные задачи, которые решают пользователи. В таких тестах видно, где система проседает или ошибается. «Это даёт нам знание о том, где теоретически или алгоритмически нужно улучшать эти системы», — сказала Невилл.[5][6]

В Microsoft Невилл пришла в 2021 году из академии. По словам Аталлы, она до сих пор профессор, преподаёт и руководит студентами уже 20 лет. Разницу между двумя мирами Невилл описала так. В индустрии можно применять методы в масштабе, в реальных системах и на реальных данных. В академии вопросы ставят абстрактнее, чтобы ответ подходил сразу ко многим областям.[7][8][9]

Невилл считает, что для тех, кто сейчас работает над AI-системами, место в индустрии. Свой выбор она объяснила тем, что видит, как алгоритмы из теории ведут себя на практике, в реальных системах, с реальными пользователями и данными. «От этого трудно отказаться. Поэтому я до сих пор здесь», — сказала она.[10][11]

Текст составлен ИИ по материалам ниже и не содержит фактов, которых нет в источниках.

  1. 1 Microsoft Research Blog — What AI gets wrong and what failure teaches us ↗ 6 октября, 19:19 · сноски 1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11 Microsoft Azure Blog — FabCon and SQLCon 2026 in Barcelona: Building the data foundation for Microsoft Copilot and agents ↗ 29 сентября, 09:30 Microsoft Azure Blog — Ship agents faster with expanded model choice, voice agents, and continuous optimization ↗ 24 сентября, 21:00
  1. 2 GeekWire — Longtime Microsoft research leader Peter Lee and former LinkedIn CEO Ryan Roslansky to depart ↗ 1 октября, 19:35 GeekWire — Week in Review: Most popular stories on GeekWire for the week of Sept. 20, 2026 ↗ 27 сентября, 18:00 GeekWire — Seattle and San Francisco: Big tech, political backlash and the AI boom ↗ 3 октября, 19:04 GeekWire — Week in Review: Most popular stories on GeekWire for the week of Sept. 27, 2026 ↗ 4 октября, 18:00 GeekWire — Amazon hires a Microsoft AI leader to help build its tools for coding and work ↗ 5 октября, 20:49 GeekWire — AI founders for hire: Startup hub Foundations launches service to connect businesses with builders ↗ 6 октября, 19:22 GeekWire — Superhuman opens new Seattle office, joining wave of AI companies expanding in the region ↗ 6 октября, 20:37 GeekWire — Yoodli’s next act: AI that can teach workers almost any job skill ↗ вчера, 16:00 GeekWire — Microsoft plays the Windows card in the AI game, with help from Nvidia ↗ вчера, 22:52
  2. 3 InfoWorld — One week to TechCrunch Disrupt: What’s next for AI and software development ↗ 6 октября, 18:50

Запись полезная?

Войдите, чтобы ответить

Anthropic выпустила Claude Haiku 5.5 по цене $0,10 за миллион входных токенов