roko.fans четверг, 8 октября 2026

SemiAnalysis выделила в инференсе MoE-моделей четыре режима с разной нагрузкой на железо

Аналитическая компания SemiAnalysis опубликовала разбор того, как устроен инференс современных языковых моделей. Главный вывод касается архитектуры MoE, то есть смеси экспертов: по оценке SemiAnalysis, она изменила структуру обслуживания моделей и экономику инференса. «Она сделала больше, чем просто увеличила число параметров», — пишут авторы.[1]

Объекты:

Работу внутри воркеров инференса SemiAnalysis делит на четыре режима. В режиме Prefill модель обрабатывает начальный блок новых токенов, в Midfill дописывает продолжение к уже сохранённому контексту. Decode attention использует контекст, чтобы получить основу новых токенов, а в Decode experts каждый такой токен дорабатывает часть экспертов из большого общего набора.[2]

Нагрузка у этих режимов разная. Prefill достигает высокой арифметической интенсивности, то есть отношения объёма вычислений к объёму перемещаемых данных. В режимах декодирования эта интенсивность обычно низкая: новых токенов мало, а прежний контекст и веса экспертов приходится перемещать.[3][4]

Инференс выполняется в кластере под управлением слоя оркестрации, например Nvidia Dynamo, Mooncake или собственного планировщика. Оркестратор работает вместе с серверами инференса вроде vLLM или SGLang. Сервер хранит контекст сессии, KV cache, и с его помощью правильно интерпретирует каждый новый запрос. Если пользователь запускает агента на длительную задачу, таких ходов может набраться до тысяч в час.[5][6][7][8]

Отдельно SemiAnalysis описывает выбор между двумя конфигурациями. В агрегированной модель остаётся на одном сервере, и тот перенастраивается по мере перехода запроса между стадиями. В дезагрегированной оркестратор может найти свободный слот на другой машине, уже подготовленной под нужную стадию.[9]

Текст составлен ИИ по материалам ниже и не содержит фактов, которых нет в источниках.

  1. 1 SemiAnalysis — Computation and Data Movement for Inference ↗ 21 сентября, 21:14 · сноски 1, 2, 3, 4, 5, 6, 7, 8, 9
  1. 2 Tom's Hardware — AI's chipmaking frontier may face patent infringement hurdles as autonomous tools take over ↗ 1 октября, 17:20 Tom's Hardware — The price of AI is crashing faster than the rate of Moore's Law, report suggests ↗ 30 сентября, 15:40 Tom's Hardware — The state of agentic AI in chip design tools in 2026 ↗ 30 сентября, 15:20 Tom's Hardware — This week on Tom's Hardware Premium: October 3, 2026 ↗ 3 октября, 17:00 Tom's Hardware — Russian firm completes country's first 130nm-capable chipmaking tool, trails modern equipment by 25 years ↗ 5 октября, 13:50 Tom's Hardware — OpenAI and Synopsys partner to build "GPT-Synopsys" for autonomous chip design ↗ 6 октября, 14:00 Tom's Hardware — Hackers suspected of using AI agents for cyberattacks on South Korean banks, exposing data from about 25,000 customers ↗ 6 октября, 15:15
  2. 3 The New Stack — SAP acquires TechWolf to feed more context into its HR agents ↗ 6 октября, 19:52

Запись полезная?

Войдите, чтобы ответить

Anthropic выпустила Claude Haiku 5.5 по цене $0,10 за миллион входных токенов