По словам Дженнифер Невилл, ML- и AI-специалисты обычно оценивают системы по бенчмаркам, и эти тесты заметно проще того, как люди пользуются AI на практике. «Поэтому мы и сосредоточены на оценке», — сказала она в беседе, которую опубликовал Microsoft Research Blog.[1]
Невилл работает партнёр-менеджером по исследованиям в Microsoft. Блог компании пишет, что вся её карьера связана с тем, чтобы понимать и развивать AI для реального применения. Её собеседник Чед Аталла работает главным прикладным учёным в Microsoft Research. В компании он чуть больше шести лет и большую часть этого времени занимается оценкой AI.[2][3]
Команда Невилл называется AI Interaction and Learning team. По её словам, команда старается продвинуть поведение AI-систем в реалистичных рабочих средах.[4]
Для этого команда строит оценки, близкие к реальной работе. Невилл перечислила, что в них входит: многоходовое поведение, совместные среды и долгосрочные задачи, которые решают пользователи. В таких тестах видно, где система проседает или ошибается. «Это даёт нам знание о том, где теоретически или алгоритмически нужно улучшать эти системы», — сказала Невилл.[5][6]
В Microsoft Невилл пришла в 2021 году из академии. По словам Аталлы, она до сих пор профессор, преподаёт и руководит студентами уже 20 лет. Разницу между двумя мирами Невилл описала так. В индустрии можно применять методы в масштабе, в реальных системах и на реальных данных. В академии вопросы ставят абстрактнее, чтобы ответ подходил сразу ко многим областям.[7][8][9]
Невилл считает, что для тех, кто сейчас работает над AI-системами, место в индустрии. Свой выбор она объяснила тем, что видит, как алгоритмы из теории ведут себя на практике, в реальных системах, с реальными пользователями и данными. «От этого трудно отказаться. Поэтому я до сих пор здесь», — сказала она.[10][11]
По материалам
Текст составлен ИИ по материалам ниже и не содержит фактов, которых нет в источниках.
The reason we focus on evaluation is that we find that the standard way that ML and AI people evaluate are through benchmarks that are fairly simple with respect to how people would actually use them in practice.
Our team is called the AI Interaction and Learning team. What we really focus on is trying to push the frontier of behavior of these AI systems in realistic work environments.
And then once we can see where the performance gaps or problems that happen in those evaluations [are], then that also gives us the knowledge of where, sort of, theoretically or algorithmically do we need to improve these systems.
in industry, your ability to apply it at scale in real systems on real data is really very different from academia, and in academia, I think you end up asking questions that are more abstractions that cover applications across a lot of different domains at once.
being able to see how algorithms in theory, kind of, hit the—where the rubber hits the road with respect to how they behave in practice and real systems and with real users and real data, that’s hard to turn back from. And so that’s now why I’m still here.