Что выпустили

NVIDIA 11 августа 2026 года опубликовала открытые веса Nemotron 3.5 Lightning 30B-A3B. Это текстовая reasoning- и chat-модель с гибридной архитектурой: слои Mamba-2, mixture-of-experts и attention. В модели 30 млрд параметров всего и 3 млрд активируются для обработки конкретного токена.

В тот же день Ollama 0.32.9 добавила архитектуру Nemotron 3 и готовую карточку `nemotron-3.5-lightning`. На странице Ollama доступны несколько вариантов; пакет `latest` указан как 25 ГБ с контекстом до 1 млн токенов, а MLX-вариант — как 23 ГБ с контекстом 256 тыс. токенов. Веса действительно доступны для скачивания, это не анонс или таймер.

Для малого и среднего бизнеса новость интересна не очередным рейтингом. Она показывает практичный класс локальной модели: вычисления на каждом шаге ближе к 3 млрд активных параметров, но качество и специализация опираются на более крупный общий набор весов. Такой компромисс может быть полезен для постоянно работающих агентов, маршрутизации задач, RAG и автоматизации — при условии, что инфраструктуру считают по полному артефакту, а не по красивой цифре A3B.

Почему 3 млрд активных — это не модель на 3 млрд

MoE-модель выбирает несколько экспертов для каждого токена. Это уменьшает объём вычислений по сравнению с плотной моделью на 30 млрд параметров, но не отменяет необходимость хранить и загружать все эксперты. Поэтому активные параметры в первую очередь описывают вычислительную работу на токен, а общий размер — требования к памяти, диску, загрузке и распространению образов.

Официальная карточка BF16 прямо указывает один H100 80 ГБ или A100 80 ГБ как однопроцессорный вариант. Для оптимизированного инференса NVIDIA рекомендует NVFP4, а Ollama предлагает квантизованные пакеты примерно 23–25 ГБ. К размеру весов нужно добавить KV-кеш, рабочие буферы рантайма, контекст, параллельные запросы и резерв операционной системы.

Отсюда два управленческих следствия:

  • цифра «3B active» не означает, что модель поместится в 4–8 ГБ памяти;
  • контекст «до 1M» не означает, что миллион токенов экономически разумно обслуживать на выбранной машине.

Длинный контекст увеличивает KV-кеш и время обработки входа. Для корпоративного помощника обычно выгоднее правильно разрезать документы, настроить поиск и передавать несколько релевантных фрагментов, чем каждый раз загружать огромный архив в prompt.

Что подтверждено, а что ещё нужно проверить

По карточке разработчика модель обучена более чем на 20 трлн токенов, поддерживает включаемый и отключаемый режим рассуждения, structured outputs и tool use. NVIDIA публикует собственные результаты на reasoning, coding и agentic-тестах, а также рецепты воспроизводимости. Эти цифры следует считать заявлениями разработчика до независимой проверки в вашем сценарии.

Список поддерживаемых естественных языков включает английский, испанский, французский, немецкий, итальянский и японский. Русский язык в официальном списке отсутствует. Это не доказывает, что модель не умеет отвечать по-русски, но делает обязательным отдельный русский набор тестов: терминология компании, склонение сущностей, извлечение реквизитов, отказ при недостатке данных и вызовы инструментов с кириллическими аргументами.

BF16-веса предназначены прежде всего для дообучения, дистилляции, исследований и создания собственных квантизаций. Для прямого сервинга карточка рекомендует NVFP4. Ollama снижает порог первого запуска, но простая команда установки не заменяет проверку качества конкретного кванта и рантайма.

Лицензия: коммерческое использование разрешено, но это не Apache 2.0

Модель распространяется по OpenMDW-1.1. Карточка называет её готовой к коммерческому использованию. Текст лицензии разрешает использование, изменение и распространение материалов модели без платы, но требует сохранять копию соглашения и применимые уведомления при распространении.

Есть и условие прекращения предоставленных прав при определённых добровольных исках о нарушении патентов или авторских прав. Кроме того, пользователь самостоятельно отвечает за проверку прав третьих лиц и необходимые разрешения. Для внутреннего пилота это обычно не стоп-фактор, но юридическая служба должна зафиксировать лицензию, источник весов и правила передачи производной модели подрядчику или клиенту.

Не следует переносить лицензию репозитория с кодом на сами веса. У разных артефактов проекта могут быть разные условия; в реестре моделей нужно хранить лицензию конкретного чекпойнта и его ревизию.

Где модель может быть полезна бизнесу

Первый разумный сценарий — локальный агент для внутренних операций, где важнее контролируемая стоимость и приватность, чем универсальное знание обо всём мире. Например:

  • классификация и маршрутизация входящих запросов;
  • поиск по регламентам с RAG и указанием источников;
  • подготовка черновиков ответов сотруднику;
  • извлечение структурированных полей из уже распознанного текста;
  • вызов безопасных инструментов для чтения статуса заказа, остатка или заявки;
  • фоновая проверка очереди исключений и подготовка отчёта.

Второй сценарий — специализированная донастройка. Полные BF16-веса и опубликованные рецепты дают основу для SFT, RL или дистилляции, если у компании есть качественные размеченные данные и понятная метрика. Но дообучение не должно быть первым шагом: часто RAG, строгая схема и хороший набор примеров в prompt решают задачу дешевле.

Неудачный сценарий — сразу дать «постоянно работающему агенту» доступ к почте, CRM, файловой системе и платежам. Назначение модели для агентов не является гарантией безопасной автономности.

Как построить безопасный локальный контур

Модельный сервер должен только генерировать предложение действия. Исполнение проходит через отдельный шлюз инструментов, который проверяет личность пользователя, роль, параметры и политику конкретной операции.

Минимальная схема включает:

1. локальный endpoint модели без прямого доступа из интернета;
2. RAG-сервис с фильтрацией документов по правам пользователя;
3. оркестратор, который ограничивает число шагов, время и бюджет токенов;
4. шлюз инструментов с allowlist операций и строгими JSON-схемами;
5. обязательное подтверждение человеком для записи, отправки и удаления;
6. журнал prompt, найденных источников, предложенного вызова, решения человека и результата;
7. аварийную остановку и возможность отозвать доступ агента без остановки остальных систем.

Для чтения статуса заказа можно разрешить конкретный метод с одним идентификатором. Для изменения цены или отправки письма нужен отдельный маршрут и подтверждение. Если модель передала лишнее поле или значение вне диапазона, шлюз отклоняет вызов, а не пытается «понять намерение».

Как проверить модель за пять рабочих дней

День 1: выберите один процесс и соберите 100–200 обезличенных примеров. Отделите обычные запросы, редкие случаи и запросы, на которые система должна отказаться отвечать.

День 2: зафиксируйте два варианта запуска — например, Ollama `latest` и один оптимизированный серверный формат. Запишите размер загрузки, время старта, пиковую память и версии всех компонентов.

День 3: измерьте качество на русском и на бизнес-терминах. Для RAG считайте правильность цитирования, для извлечения — exact match полей, для агента — корректность имени инструмента и аргументов.

День 4: проведите нагрузочный тест с реальной длиной prompt. Снимите p50/p95 задержки, tokens per second, число параллельных запросов, память и долю ошибок. Отдельно проверьте длинные контексты: максимум из карточки не должен быть настройкой по умолчанию.

День 5: запустите теневой режим. Модель предлагает ответ или действие, но сотрудник продолжает текущий процесс. Масштабировать стоит только при заранее утверждённых порогах качества, времени и стоимости.

Модельная экономика

Допустим, внутренний помощник обрабатывает 12 000 запросов в месяц. Сотрудник тратит на поиск и черновик в среднем четыре минуты. Пилот сокращает время до двух минут для 60% запросов, остальные не ускоряет.

Эти запросы раньше занимали 480 часов: 7 200 запросов × 2 минуты = 240 часов, а без помощника эти запросы заняли бы 480 часов; вместе с неизменившимися запросами высвобождается 240 часов, а не 480. При полной стоимости часа 1 100 рублей модельный ресурсный эффект — 264 000 рублей в месяц.

Если сервер, электричество, сопровождение и контроль качества стоят 120 000 рублей в месяц, модельный чистый эффект равен 144 000 рублей. При стоимости внедрения 1,15 млн рублей простой срок окупаемости — около восьми месяцев.

Это пример, а не обещание. В расчёт нужно подставить реальную долю полезных ответов, стоимость проверки, простой оборудования и цену ошибок. Если высвободившееся время не уменьшает сверхурочные, срок ответа или потребность в найме, оно не превращается в денежный эффект автоматически.

Что взять руководителю

Nemotron 3.5 Lightning интересен сочетанием 30 млрд общих и 3 млрд активных параметров, готовых весов и поддержки в Ollama. Но «активных 3 млрд» нельзя использовать как оценку памяти, а модель без русского в официальном списке нельзя подключать к сотрудникам без собственного теста.

Практичный следующий шаг — не закупка сервера, а пятидневная проверка одного процесса на имеющемся стенде. Зафиксируйте русский золотой набор, две конфигурации, предел контекста, правила инструментов и модельную экономику. Если модель проходит пороги, тогда выбирайте постоянную инфраструктуру и формат весов.