Что именно вышло

10 августа 2026 года Meta открыла веса Muse Glimmer — мультимодальной модели примерно на 30 млрд параметров, рассчитанной на локальные агентные сценарии. Она принимает текст и изображения, выдаёт текст, поддерживает вызов инструментов и длинные многошаговые задачи. Официальная модельная карточка указывает контекст 131 072 токена и обучение на данных более чем ста языков.

Для малого и среднего бизнеса важнее не очередная строка в таблице бенчмарков, а изменившийся порог инфраструктуры. Meta опубликовала BF16-веса и две 4-битные версии. Вариант K-Quant-17GB занимает 16,8 ГБ, динамический — 19,7 ГБ. Заявленная целевая конфигурация — 24 или 32 ГБ памяти, куда должны поместиться не только веса, но и KV-кэш, зрительный энкодер и вспомогательная модель DFlash для ускорения генерации.

Веса действительно доступны, а не только анонсированы. В официальной коллекции есть GGUF для llama.cpp, сборки ExecuTorch и отдельный drafter. Лицензия — Apache 2.0, однако вместе с ней опубликована политика допустимого использования. Для коммерческого проекта нужно проверить обе части и собственные юридические требования, а не ограничиваться строкой `apache-2.0` в карточке.

Какой бизнес-процесс становится реалистичнее

Muse Glimmer интересна там, где агент должен одновременно видеть документ или экран, рассуждать и обращаться к локальным инструментам. Например:

  • разобрать скан заявки и сверить поля со справочником;
  • посмотреть на экран внутренней системы и подготовить последовательность действий;
  • найти сведения в локальном RAG, заполнить черновик карточки CRM и передать его сотруднику;
  • проверить код автоматизации или SQL-запрос в изолированном стенде;
  • выступить локальным судьёй качества для ответов более дешёвой модели.

Это не означает, что модель должна сама отправлять платёж, менять реквизиты или удалять запись. Практический вывод обратный: когда локальная модель стала достаточно сильной для инструментов, границы полномочий становятся важнее выбора модели.

Первый пилот разумно строить вокруг одного процесса и одного типа решения. Хороший кандидат — частая операция, где сотрудник уже следует понятной инструкции, а ошибку можно заметить до необратимого действия. Плохой кандидат — редкое решение с высокой ценой ошибки, неформализованными правилами и отсутствием контрольной выборки.

Минимальная архитектура локального агента

Рабочий контур состоит не из одной модели. Для безопасного пилота нужны как минимум шесть слоёв.

1. **Локальный сервер модели.** llama.cpp подходит для одного узла и GGUF; Transformers, vLLM или SGLang — для более привычного серверного контура. Версию весов, квантизации, шаблона чата и параметров генерации нужно фиксировать как одну сборку.
2. **Оркестратор.** Он хранит состояние задачи, ограничивает число шагов и решает, какой инструмент можно предложить модели. Модель не должна сама определять свои полномочия.
3. **Шлюз инструментов.** Каждый вызов проходит проверку схемы, пользователя, объекта, лимита и разрешённой операции. В пилоте полезнее три узких инструмента, чем универсальный доступ к сети и файловой системе.
4. **Разделение чтения и записи.** Поиск, просмотр карточки и расчёт можно разрешать автоматически. Изменение CRM, отправка письма и платёж должны идти через отдельный исполнитель и подтверждение человека.
5. **Журнал операций.** Нужны вход, выбранные источники, предложенные действия, ответы инструментов, итог и решение сотрудника. Секреты и лишние персональные данные в журнал не копируют.
6. **Оценка и аварийная остановка.** Заранее задаются лимит шагов, времени и стоимости, а также условия, при которых задача возвращается человеку.

Официальный cookbook Meta отдельно предупреждает о контексте при параллельных слотах llama.cpp: общий размер делится между ними. Четыре слота при общем контексте 131 072 дают по 32 768 токенов на задачу. Поэтому большой заявленный контекст нельзя одновременно считать бесплатным и доступным каждому пользователю.

Какие данные подготовить

Мультимодальность не отменяет работу с данными. Для пилота нужны:

  • 50–100 реальных задач с ожидаемым результатом;
  • документы и снимки экранов в тех форматах и качестве, которые встречаются в работе;
  • эталонные ответы или решения сотрудников;
  • перечень разрешённых и запрещённых действий;
  • примеры неоднозначных случаев, когда агент обязан остановиться;
  • отдельная выборка на русском языке и с вашей отраслевой терминологией.

Заявление о более чем ста языках не означает подтверждённого качества русского в конкретном процессе. Модельная карточка прямо отмечает, что не все языки были полноценно оценены. Поэтому качество русского интерфейса, извлечения реквизитов и вызова функций нужно измерять на собственных примерах.

Для документов полезно хранить происхождение каждого фрагмента: файл, страницу, версию и права доступа. Для изображений — исходный файл и координаты области. Тогда сотрудник проверяет не красивое объяснение модели, а конкретное основание решения.

Ограничения и риски

Главный риск локального агента — не утечка в облако, а избыточное действие внутри доверенного контура. Документ, письмо или веб-страница могут содержать инструкцию, которую модель ошибочно примет за команду. Локальное размещение не защищает от косвенной prompt-инъекции.

Поэтому непроверенный контент должен считаться данными, а не инструкциями. Разрешения применяются до вызова инструмента. Критические параметры — получатель, сумма, объект изменения — сверяются детерминированными правилами. Необратимое действие требует подтверждения с понятным предварительным просмотром.

Есть и эксплуатационные ограничения:

  • 24–32 ГБ — целевая конфигурация разработчика, а не гарантия вашей скорости;
  • длинный контекст увеличивает KV-кэш и конфликтует с параллельностью;
  • 4-битная версия может отличаться от BF16 в пограничных случаях;
  • поддержка нового формата в рантайме должна быть проверена на конкретной версии;
  • модель может ошибаться в новых многошаговых сценариях и некорректно восстанавливаться после сбоя;
  • январь 2026 года указан как граница знаний, поэтому актуальные сведения всё равно должны приходить из RAG или инструментов.

Бенчмарки в модельной карточке опубликованы разработчиком. Они полезны для отбора кандидата, но не заменяют теневой прогон на задачах компании и независимую приёмку человеком.

Экономика: считать не память, а принятые задачи

Появление 17–20-гигабайтной квантизации делает эксперимент доступнее, но само по себе не доказывает окупаемость. Нужна стоимость принятого результата:

`(амортизация узла + электричество + сопровождение + проверка человеком + стоимость ошибок) / число принятых задач`.

Модельный пример: узел за 350 тыс. рублей амортизируется за 36 месяцев — около 9,7 тыс. рублей в месяц. Добавим 5 тыс. на электричество и резерв, 20 тыс. на сопровождение и 30 тыс. на проверку человеком. При 4 тыс. принятых задач получаем примерно 16 рублей за задачу. Если реально принимаются только 500 результатов, стоимость вырастает примерно до 129 рублей.

Это не рыночная смета, а иллюстрация чувствительности. В расчёт нужно подставить цену вашего оборудования, загрузку, зарплаты, резервирование и долю принятых результатов. Для небольшой нагрузки облачный API может оказаться дешевле и быстрее для старта. Локальный контур выигрывает, когда есть требования к данным, стабильный объём, повторно используемая инфраструктура или недопустима зависимость от внешнего соединения.

Что сделать руководителю за десять рабочих дней

1. Выберите один процесс с проверяемым результатом и не более чем одним инструментом записи.
2. Соберите 50–100 задач, включая ошибки, плохие сканы и русскую терминологию.
3. Разверните 4-битную версию в изолированном контуре и зафиксируйте конфигурацию.
4. Первую неделю оставьте инструменты в режиме чтения или черновика.
5. Измеряйте долю принятых результатов, p95 времени, число шагов, причины остановки и минуты проверки человеком.
6. Разрешите запись только после отдельного теста прав, повторов, отката и подтверждения.

Решение о продолжении принимают не по эффектной демонстрации, а по трём условиям: качество на ваших данных, управляемые полномочия и стоимость принятой задачи. Muse Glimmer снижает инфраструктурный порог для локального мультимодального агента. Ответственность за процесс, как и раньше, остаётся у бизнеса.