Что произошло
22 сентября 2026 года Hugging Face сообщила о возможности запускать квантованные файлы GGUF в Transformers через `from_pretrained(..., gguf_file=...)`. Раньше библиотека могла импортировать такой файл с распаковкой весов; новая интеграция на поддерживаемом оборудовании использует ядра ggml и сохраняет компактное представление при вычислении. В качестве начальной цели команда называет Apple Silicon и семейство Qwen3.5. Код, по опубликованной инструкции, пока нужен из ветки `main` Transformers вместе с совместимой версией `kernels`, а не из очередного стабильного релиза.
Практический смысл для небольшой команды — один GGUF-файл можно проверить в знакомых сценариях Python: сравнить качество квантизаций на своих документах, использовать оценочные скрипты и, при необходимости, поднять `transformers serve` с OpenAI-совместимым интерфейсом. Например, в материале указан файл Qwen3.5-4B Q4_K_M размером 2,74 ГБ против 8,42 ГБ у BF16-версии. Это размер файла, не обещание такого же расхода оперативной памяти при работе.
Где граница новости
Это не основание автоматически переводить рабочий сервер с llama.cpp. Сама Hugging Face продолжает рекомендовать llama.cpp, если главная задача — эффективный локальный инференс. Оптимизированный путь пока аппаратно и архитектурно ограничен; при отсутствии совместимого ядра Transformers предупреждает о возврате к деквантизации, что повышает расход памяти. Опубликованные замеры сделаны на MacBook Pro M2 Max с 32 ГБ объединённой памяти, причём условия сравнения не тождественны: показатель llama.cpp измеряет декодирование, а замер Transformers включает обработку короткого входа. Универсального вывода о равной скорости для Windows, Linux и других моделей из них нет.
Для российского бизнеса разумный следующий тест — не закупка компьютеров под заголовок, а запуск своего набора из 30–50 типовых задач на уже имеющемся Mac: качество ответов, пиковая память, задержка первого токена и стоимость проверки результата человеком. Лицензию конкретной модели и право коммерческого использования нужно проверять отдельно: поддержка формата GGUF их не меняет.
Фото: SimonWaldherr / Wikimedia Commons, CC BY-SA 4.0; квадратное кадрирование оригинала. Кадрированная версия доступна на тех же условиях CC BY-SA 4.0. На снимке MacBook Pro M2 Max — устройство того же класса, что использовалось в опубликованных замерах.
