Что именно вышло
10 августа 2026 года Meta открыла веса Muse Glimmer — мультимодальной модели примерно на 30 млрд параметров, рассчитанной на локальные агентные сценарии. Она принимает текст и изображения, выдаёт текст, поддерживает вызов инструментов и длинные многошаговые задачи. Официальная модельная карточка указывает контекст 131 072 токена и обучение на данных более чем ста языков.
Для малого и среднего бизнеса важнее не очередная строка в таблице бенчмарков, а изменившийся порог инфраструктуры. Meta опубликовала BF16-веса и две 4-битные версии. Вариант K-Quant-17GB занимает 16,8 ГБ, динамический — 19,7 ГБ. Заявленная целевая конфигурация — 24 или 32 ГБ памяти, куда должны поместиться не только веса, но и KV-кэш, зрительный энкодер и вспомогательная модель DFlash для ускорения генерации.
Веса действительно доступны, а не только анонсированы. В официальной коллекции есть GGUF для llama.cpp, сборки ExecuTorch и отдельный drafter. Лицензия — Apache 2.0, однако вместе с ней опубликована политика допустимого использования. Для коммерческого проекта нужно проверить обе части и собственные юридические требования, а не ограничиваться строкой `apache-2.0` в карточке.
Какой бизнес-процесс становится реалистичнее
Muse Glimmer интересна там, где агент должен одновременно видеть документ или экран, рассуждать и обращаться к локальным инструментам. Например:
- разобрать скан заявки и сверить поля со справочником;
- посмотреть на экран внутренней системы и подготовить последовательность действий;
- найти сведения в локальном RAG, заполнить черновик карточки CRM и передать его сотруднику;
- проверить код автоматизации или SQL-запрос в изолированном стенде;
- выступить локальным судьёй качества для ответов более дешёвой модели.
Это не означает, что модель должна сама отправлять платёж, менять реквизиты или удалять запись. Практический вывод обратный: когда локальная модель стала достаточно сильной для инструментов, границы полномочий становятся важнее выбора модели.
Первый пилот разумно строить вокруг одного процесса и одного типа решения. Хороший кандидат — частая операция, где сотрудник уже следует понятной инструкции, а ошибку можно заметить до необратимого действия. Плохой кандидат — редкое решение с высокой ценой ошибки, неформализованными правилами и отсутствием контрольной выборки.
Минимальная архитектура локального агента
Рабочий контур состоит не из одной модели. Для безопасного пилота нужны как минимум шесть слоёв.
1. **Локальный сервер модели.** llama.cpp подходит для одного узла и GGUF; Transformers, vLLM или SGLang — для более привычного серверного контура. Версию весов, квантизации, шаблона чата и параметров генерации нужно фиксировать как одну сборку.
2. **Оркестратор.** Он хранит состояние задачи, ограничивает число шагов и решает, какой инструмент можно предложить модели. Модель не должна сама определять свои полномочия.
3. **Шлюз инструментов.** Каждый вызов проходит проверку схемы, пользователя, объекта, лимита и разрешённой операции. В пилоте полезнее три узких инструмента, чем универсальный доступ к сети и файловой системе.
4. **Разделение чтения и записи.** Поиск, просмотр карточки и расчёт можно разрешать автоматически. Изменение CRM, отправка письма и платёж должны идти через отдельный исполнитель и подтверждение человека.
5. **Журнал операций.** Нужны вход, выбранные источники, предложенные действия, ответы инструментов, итог и решение сотрудника. Секреты и лишние персональные данные в журнал не копируют.
6. **Оценка и аварийная остановка.** Заранее задаются лимит шагов, времени и стоимости, а также условия, при которых задача возвращается человеку.
Официальный cookbook Meta отдельно предупреждает о контексте при параллельных слотах llama.cpp: общий размер делится между ними. Четыре слота при общем контексте 131 072 дают по 32 768 токенов на задачу. Поэтому большой заявленный контекст нельзя одновременно считать бесплатным и доступным каждому пользователю.
Какие данные подготовить
Мультимодальность не отменяет работу с данными. Для пилота нужны:
- 50–100 реальных задач с ожидаемым результатом;
- документы и снимки экранов в тех форматах и качестве, которые встречаются в работе;
- эталонные ответы или решения сотрудников;
- перечень разрешённых и запрещённых действий;
- примеры неоднозначных случаев, когда агент обязан остановиться;
- отдельная выборка на русском языке и с вашей отраслевой терминологией.
Заявление о более чем ста языках не означает подтверждённого качества русского в конкретном процессе. Модельная карточка прямо отмечает, что не все языки были полноценно оценены. Поэтому качество русского интерфейса, извлечения реквизитов и вызова функций нужно измерять на собственных примерах.
Для документов полезно хранить происхождение каждого фрагмента: файл, страницу, версию и права доступа. Для изображений — исходный файл и координаты области. Тогда сотрудник проверяет не красивое объяснение модели, а конкретное основание решения.
Ограничения и риски
Главный риск локального агента — не утечка в облако, а избыточное действие внутри доверенного контура. Документ, письмо или веб-страница могут содержать инструкцию, которую модель ошибочно примет за команду. Локальное размещение не защищает от косвенной prompt-инъекции.
Поэтому непроверенный контент должен считаться данными, а не инструкциями. Разрешения применяются до вызова инструмента. Критические параметры — получатель, сумма, объект изменения — сверяются детерминированными правилами. Необратимое действие требует подтверждения с понятным предварительным просмотром.
Есть и эксплуатационные ограничения:
- 24–32 ГБ — целевая конфигурация разработчика, а не гарантия вашей скорости;
- длинный контекст увеличивает KV-кэш и конфликтует с параллельностью;
- 4-битная версия может отличаться от BF16 в пограничных случаях;
- поддержка нового формата в рантайме должна быть проверена на конкретной версии;
- модель может ошибаться в новых многошаговых сценариях и некорректно восстанавливаться после сбоя;
- январь 2026 года указан как граница знаний, поэтому актуальные сведения всё равно должны приходить из RAG или инструментов.
Бенчмарки в модельной карточке опубликованы разработчиком. Они полезны для отбора кандидата, но не заменяют теневой прогон на задачах компании и независимую приёмку человеком.
Экономика: считать не память, а принятые задачи
Появление 17–20-гигабайтной квантизации делает эксперимент доступнее, но само по себе не доказывает окупаемость. Нужна стоимость принятого результата:
`(амортизация узла + электричество + сопровождение + проверка человеком + стоимость ошибок) / число принятых задач`.
Модельный пример: узел за 350 тыс. рублей амортизируется за 36 месяцев — около 9,7 тыс. рублей в месяц. Добавим 5 тыс. на электричество и резерв, 20 тыс. на сопровождение и 30 тыс. на проверку человеком. При 4 тыс. принятых задач получаем примерно 16 рублей за задачу. Если реально принимаются только 500 результатов, стоимость вырастает примерно до 129 рублей.
Это не рыночная смета, а иллюстрация чувствительности. В расчёт нужно подставить цену вашего оборудования, загрузку, зарплаты, резервирование и долю принятых результатов. Для небольшой нагрузки облачный API может оказаться дешевле и быстрее для старта. Локальный контур выигрывает, когда есть требования к данным, стабильный объём, повторно используемая инфраструктура или недопустима зависимость от внешнего соединения.
Что сделать руководителю за десять рабочих дней
1. Выберите один процесс с проверяемым результатом и не более чем одним инструментом записи.
2. Соберите 50–100 задач, включая ошибки, плохие сканы и русскую терминологию.
3. Разверните 4-битную версию в изолированном контуре и зафиксируйте конфигурацию.
4. Первую неделю оставьте инструменты в режиме чтения или черновика.
5. Измеряйте долю принятых результатов, p95 времени, число шагов, причины остановки и минуты проверки человеком.
6. Разрешите запись только после отдельного теста прав, повторов, отката и подтверждения.
Решение о продолжении принимают не по эффектной демонстрации, а по трём условиям: качество на ваших данных, управляемые полномочия и стоимость принятой задачи. Muse Glimmer снижает инфраструктурный порог для локального мультимодального агента. Ответственность за процесс, как и раньше, остаётся у бизнеса.
