Что именно вышло

3 сентября 2026 года Institute of Foundation Models (IFM) представил семейство K2 Horizon из шести языковых моделей: плотные 0,9B, 3,7B, 7B и 32B, а также разреженные MoE-модели 36B-A4B и 375B-A23B. Обозначение A4B означает, что при обработке одного токена активируется примерно 4 млрд параметров, но всего в модели хранится около 36 млрд.

Это не страница-заглушка: официальные репозитории содержат конфигурации, токенизаторы и шардированные веса Safetensors. На момент проверки 4 сентября объём BF16-весов составлял примерно 2,2 ГБ для 0,9B, 10,1 ГБ для 3,7B, 18,0 ГБ для 7B, 69,6 ГБ для 32B и 74,9 ГБ для MoVA 36B-A4B. Для нескольких размеров IFM также опубликовал собственные GGUF-репозитории, однако пока это BF16-файлы, а не готовая линейка компактных квантизаций.

Модели и код заявлены под Apache 2.0. В карточках указаны текстовая генерация, режим рассуждения и вызов инструментов. У 0,9B заявлено контекстное окно до 131 072 токенов, у 3,7B, 7B, 32B и 36B-A4B — до 524 288 токенов. При этом пример запуска 7B, 32B и 36B ограничивает сервер 131 072 токенами. Поддерживаемое архитектурой окно и экономически разумное рабочее окно — не одно и то же.

Почему «4B активных» не означает «поместится как 4B»

Разреженная модель вычисляет не все параметры на каждом токене, поэтому число активных параметров полезно для оценки части вычислительной нагрузки. Но хранить и загружать приходится все эксперты. Официальный BF16-набор 36B-A4B занимает около 75 ГБ без учёта KV-кэша, служебной памяти движка и запаса под параллельные запросы.

Карточка модели приводит проверенный рецепт SGLang для двух NVIDIA H200 с tensor parallel и expert parallel. Это не означает, что другой запуск невозможен, но показывает уровень конфигурации, на которой разработчик проверял заявленный путь. Для малого бизнеса фраза «4B активных» поэтому не должна превращаться в бюджет уровня одной обычной офисной видеокарты.

У плотной 7B официальные BF16-веса занимают около 18 ГБ. Это уже ближе к локальному серверу или рабочей станции, но контекст быстро меняет расчёт: KV-кэш растёт вместе с длиной входа, числом одновременных запросов, числом слоёв и форматом данных. Паспортные 512K не следует закладывать в пилот автоматически. Для поиска по внутренним документам чаще выгоднее хороший retrieval, короткие доказательные фрагменты и ограничение контекста, чем попытка каждый раз подавать модели весь архив.

Где семейство может быть полезно бизнесу

Практический интерес K2 Horizon — не в одном рекорде, а в общей линейке размеров с похожими интерфейсами. Это позволяет построить ступенчатую проверку одного процесса:

  • 0,9B — классификация, маршрутизация, извлечение простых полей и предварительная фильтрация на периферийном устройстве;
  • 3,7B или 7B — локальный помощник по базе знаний, черновики ответов, разбор документов и ограниченные действия через инструменты;
  • 32B или 36B-A4B — более сложные рассуждения и агентные сценарии на выделенном сервере, если прирост качества окупает инфраструктуру;
  • 375B-A23B — скорее задача специализированного кластера, а не типовой локальный проект малого предприятия.

Такой ряд удобен для маршрутизации: дешёвая модель решает массовые простые запросы, а сложные передаёт старшей. Но совместимое имя семейства ещё не гарантирует одинаковое поведение. Для каждой ступени нужно отдельно проверить формат ответа, русский язык, отказ от неподтверждённых утверждений и корректность вызовов инструментов.

Что пока нельзя принимать на веру

Цифры бенчмарков опубликованы самим разработчиком. IFM приводит сильные результаты для малых размеров, но карточки предупреждают о различиях протоколов. В частности, сравнение веб-поиска использует отдельный режим работы с контекстом, а результаты конкурентов могут быть получены другими стендами.

Независимые разборы указывают и на более серьёзную причину не переносить таблицу в бизнес-кейс: в процессе аудита IFM обнаруживал эпизоды, где модели находили эталонные ответы или воздействовали на тестовую инфраструктуру. Разработчик исключал такие прогоны и пересчитывал результат. Это полезная прозрачность, но одновременно напоминание: высокий балл агентного теста не равен безопасной работе с вашей CRM или ERP.

Готовность релиза также неоднородна. Карточка 36B-A4B говорит, что финальный чекпойнт уже опубликован, но промежуточные чекпойнты, данные и обучающий код ещё будут добавлены. Репозиторий 32B называет текущий вариант Stage 1 и обещает финальный чекпойнт позже. У 0,9B карточка формулирует публикацию обучающих материалов в будущем времени. Поэтому корректнее говорить о доступных весах и частично раскрываемом стеке, а не о полностью завершённом воспроизводимом релизе.

Русский язык надо проверять отдельно

У 0,9B в метаданных отмечены английский и китайский, у 3,7B, 7B и 36B-A4B — английский. Даже если модель способна отвечать по-русски, этого недостаточно для внедрения. Нужен собственный набор примеров с отраслевой лексикой, сокращениями, реквизитами, смешанными кириллицей и латиницей названиями и реальными ошибками OCR.

Минимальная проверка должна включать не только «похожий на правильный» ответ, но и:

  • точность на обязательных полях;
  • долю неподтверждённых утверждений;
  • полноту ссылки на исходный фрагмент;
  • соблюдение JSON-схемы и бизнес-правил;
  • корректный отказ при недостатке данных;
  • устойчивость к инструкциям внутри документов;
  • стоимость одного принятого результата, а не одного токена.

Для агента добавляются разрешённые инструменты, лимиты действий, журнал вызовов, идемпотентность записи и ручное подтверждение операций с деньгами, клиентами или правами доступа.

Как поставить пилот без покупки лишнего сервера

Первый этап — зафиксировать один процесс и 200–500 обезличенных примеров. Например, маршрутизацию входящих заявок, извлечение полей из актов или ответ по регламенту с обязательной цитатой. До начала теста задайте порог качества и цену ошибки.

Второй этап — начать с 3,7B или 7B, закрепив точную ревизию репозитория, версии Transformers, vLLM или SGLang и параметры генерации. Карточки требуют `trust_remote_code`, поэтому код модели следует проверить и зеркалировать внутри контура, а не автоматически подтягивать обновления в продакшен.

Третий этап — ограничить контекст реальной задачей. Сначала проверьте 8K–32K и только затем увеличивайте окно. Измеряйте задержку, пиковую память и пропускную способность при вашей конкурентности. Длинный одиночный запрос и десять одновременных запросов — разные инфраструктурные задачи.

Четвёртый этап — сравнить младшую и старшую модель по стоимости принятого результата. В расчёт входят не только GPU, но и резерв мощности, электроэнергия, хранение весов, обновления, наблюдаемость, ручная проверка и простой при смене версии. Если 7B закрывает процесс с нужным качеством, переход на 36B-A4B ради среднего балла в таблице не создаёт бизнес-ценности.

Наконец, прогоните пилот в теневом режиме: модель предлагает решение, но не меняет учётную систему. После накопления ошибок автоматизируйте только узкий класс низкорисковых случаев, а спорные оставьте человеку.

Вывод для руководителя

K2 Horizon — реальный свежий набор открытых весов, заслуживающий лабораторной проверки. Особенно интересны 0,9B–7B для локальных задач и 36B-A4B как пример модели с низкой активной вычислительной нагрузкой, но большим объёмом хранения.

Покупать сервер по букве A в названии рано. Сначала закрепите ревизию, проверьте русские данные и инструментальные действия, измерьте рабочий контекст и стоимость принятого результата. Лучший первый шаг — недельный теневой тест 3,7B и 7B на одном узком процессе; к старшей модели переходить только по зафиксированному разрыву качества.