Что именно выпустила IBM
IBM опубликовала Granite Time Series PatchTST-FM-r2 — открытую фундаментальную модель для прогнозирования временных рядов. Это не языковая модель и не чат-бот: на вход она получает последовательность числовых наблюдений, а на выходе строит прогноз на заданный горизонт. Для малого и среднего бизнеса это может быть спрос по дням, нагрузка на оборудование по минутам, энергопотребление по часам или число обращений по неделям.
Главное практическое отличие от классического проекта машинного обучения — возможность начать с zero-shot-режима. Модель уже предварительно обучена на большом наборе временных рядов, поэтому для первого теста не требуется заново обучать отдельную нейросеть на истории конкретной компании. Это сокращает путь до сравнительного эксперимента, но не отменяет проверку качества и экономического эффекта на собственных данных.
Согласно модельной карточке и публикации IBM от 9 сентября 2026 года:
- модель содержит около 385 млн параметров;
- максимальная длина контекста при обучении составляет 8 192 шага;
- прогнозная голова выдаёт 99 квантилей, то есть позволяет оценивать не только одну точку, но и диапазон неопределённости;
- доступны веса в Safetensors, код архитектуры и конвейер инференса;
- модель можно использовать по Apache 2.0 или OpenMDW 1.0;
- для запуска предлагается пакет `granite-tsfm` версии 0.3.9 или новее.
Что подтверждает бенчмарк, а чего он не доказывает
IBM сообщает, что по состоянию на 31 августа PatchTST-FM-r2 занимала второе место по CRPS и MASE среди воспроизводимых zero-shot-моделей без утечки тестовых данных в GIFT-Eval. Среди моделей той же категории с разрешительной коммерческой лицензией она была первой. В публикации от 9 сентября приведены геометрические средние: CRPS 0,467 и MASE 0,6846.
Это сильный сигнал для отбора кандидата, но не готовое бизнес-обоснование. GIFT-Eval объединяет разные домены, частоты и горизонты. Среднее место в таблице не говорит, насколько хорошо модель предскажет конкретный SKU с редкими продажами, кассовый поток компании или перегрев определённого станка.
Есть и важная оговорка: в модельной карточке сказано, что результаты PatchTST-FM-r2 находились в ожидающем рассмотрения запросе на добавление в репозиторий GIFT-Eval. Код воспроизведения опубликован, однако руководителю разумно трактовать позицию в рейтинге как заявление разработчика, опирающееся на открытый протокол, а не как гарантию результата в своей компании.
Бенчмарк также не отвечает на вопросы о задержке, пропускной способности и стоимости эксплуатации на вашем сервере. Карточка указывает F32 и 0,4 млрд параметров. Только веса при 32-битном хранении дают приблизительно 1,5 ГБ; фактическое потребление памяти будет выше из-за среды выполнения, промежуточных тензоров, длины контекста и размера пакета. Профиль эталонного производственного оборудования и гарантированная задержка не опубликованы — их нужно измерять.
Где модель может принести пользу
Первый разумный сценарий — процесс, где уже есть регулярно измеряемый ряд и решение действительно зависит от будущего значения.
- Розница и дистрибуция: дневной спрос, пополнение запасов, загрузка склада.
- Производство: энергопотребление, выпуск, телеметрия, потребность в расходных материалах.
- Сервис: поток заявок, нагрузка смен, число звонков или выездов.
- Финансы: поступления, выплаты и операционная ликвидность — только как вспомогательный прогноз, а не автономное финансовое решение.
- ИТ: загрузка CPU, память, трафик и ёмкость инфраструктуры.
Квантильный выход особенно полезен там, где цена ошибки несимметрична. Для закупок опасны и дефицит, и избыток, но их стоимость различается. Вместо одного числа «продадим 120 единиц» система может показать медиану и интервал, например границы с вероятностями 10%, 50% и 90%. Политику запаса затем определяет человек или проверяемое бизнес-правило.
Не стоит начинать с ряда, где решение формируется главным образом неизвестными модели событиями: разовыми промоакциями, сменой цены, крупным контрактом, погодой, остановкой линии или календарём поставщика. В опубликованном примере конвейер работает с целевым рядом и временными метками. Наличие в бизнесе внешних факторов ещё не означает, что модель автоматически понимает их причинное влияние.
Какие данные потребуются
Для пилота нужен не «дата-лейк», а аккуратно определённая таблица. Минимальная запись содержит временную метку, идентификатор ряда и целевое значение. До теста следует зафиксировать:
- единицу наблюдения: товар, магазин, станок, очередь или услуга;
- частоту: час, день, неделя;
- горизонт решения: следующая смена, семь дней или квартал;
- часовой пояс и правила перехода времени;
- смысл нулей и пропусков;
- историю изменений справочников, цен и ассортимента;
- моменты акций, аварий, закрытий и других режимных сдвигов.
8 192 шага — это технический верхний предел контекста, а не требование всегда подавать весь архив. При дневной частоте это более 22 лет, при почасовой — около 341 дня. Полезную длину следует выбирать на ретроспективной проверке: слишком короткое окно теряет сезонность, слишком длинное может смешать старый и новый режим бизнеса.
Пропуски нельзя механически превращать в нули. Ноль продаж может означать отсутствие спроса, закрытый магазин, отсутствие товара на полке или сбой загрузки. Модель поддерживает заполнение пропусков, но способ заполнения должен соответствовать бизнес-смыслу. Иначе получится точный прогноз того, как компания неправильно подготовила данные.
Архитектура безопасного локального пилота
Для первого контура достаточно пяти компонентов.
1. Выгрузка истории из ERP, учётной системы, SCADA или базы мониторинга в отдельное хранилище пилота.
2. Валидатор частоты, дублей, пропусков, выбросов и смены справочников.
3. Зафиксированная версия весов и `granite-tsfm` в изолированном окружении без доступа к боевым системам на запись.
4. Сервис прогнозов, который сохраняет входной срез, версию модели, горизонт, квантили и время расчёта.
5. Панель сравнения с фактом и очередь решений для ответственного сотрудника.
Локальное размещение позволяет не отправлять историю продаж или телеметрию внешнему API. Однако слово «локальный» не делает систему автоматически защищённой. Нужны права доступа к рядам, журналирование запусков, проверка загружаемых артефактов, контроль зависимостей и запрет прямой записи прогноза в ERP на первом этапе.
Модель следует закрепить по точной ревизии репозитория, а не по плавающему имени. Воспроизводимость прогноза зависит не только от весов, но и от версии кода, параметров нормализации, длины контекста, частоты и процедуры заполнения пропусков.
Как проверить за четыре недели
Пилот полезно проводить в теневом режиме: прогноз рассчитывается по расписанию, но закупка, план смены или управление оборудованием остаются в действующем процессе.
Сначала выберите 20–50 рядов, которые представляют разные типы поведения: стабильные, сезонные, прерывистые, растущие и чувствительные к акциям. Для каждого несколько раз имитируйте прошлое: обрезайте историю в контрольной точке и прогнозируйте известное будущее. Это временная кросс-проверка; случайно перемешивать наблюдения нельзя.
Сравните минимум три участника:
- текущий прогноз компании;
- простой базовый метод — последнее значение или сезонное значение прошлой недели/года;
- PatchTST-FM-r2 без дообучения.
Для среднего качества можно считать WAPE или MASE, для квантилей — pinball loss и долю фактов, попавших в заявленный интервал. Но финальная метрика должна быть бизнесовой: рубли списаний, упущенная маржа, аварийные заказы, часы простоя или переработки сотрудников.
Не выбирайте победителя по одному среднему числу. Разрежьте результат по товарам, горизонтам и режимам. Если модель лучше на стабильном спросе, но ошибается на промо, это не повод выбросить её: можно ограничить область применения и передавать исключения человеку.
Как считать экономику
Zero-shot снижает стоимость старта, потому что не требует отдельного обучения модели. Но остаются затраты на подготовку истории, интеграцию, ретроспективную оценку, мониторинг и разбор исключений.
Простая модель решения выглядит так:
`эффект = предотвращённые потери + высвобождённый оборотный капитал + сэкономленные часы − стоимость пилота − стоимость эксплуатации`.
Для модели такого размера главным бюджетом пилота часто будет не GPU, а работа аналитика и владельца процесса. Если данные уже чистые и доступны, zero-shot-кандидат можно сравнить с базовой линией за несколько дней. Если справочники менялись без истории, продажи смешаны с отсутствием товара, а календарь акций хранится в переписке, сначала придётся восстановить процесс данных.
Ограничения и риски
- Zero-shot не означает «без настройки»: остаются частота, окно контекста, горизонт, квантили и очистка данных.
- Временной ряд может резко изменить режим после новой цены, оборудования или канала продаж.
- Хорошая статистическая ошибка не гарантирует выгодного управленческого решения.
- Длинный контекст увеличивает вычисления и может подтянуть устаревший режим.
- Лицензия разрешительна, но компании всё равно нужен собственный юридический и ИБ-контроль зависимостей.
- Открытая публикация не обещает сопровождение: IBM прямо указывает, что проект предоставлен без обязательства обновлять или поддерживать его.
Что сделать руководителю сейчас
Выберите один регулярный процесс с понятной ценой ошибки и сформируйте 20–50 рядов. Зафиксируйте горизонт решения, простой базовый прогноз и денежную метрику. Разверните модель локально по точной ревизии, проведите ретроспективный тест и четыре недели теневого сравнения.
Переходить к интеграции стоит только если модель устойчиво выигрывает у базы на нужных сегментах, интервалы неопределённости откалиброваны, а улучшение превращается в конкретное управленческое действие. Новая модель делает эксперимент дешевле; доказанный процесс делает его полезным.
