Transformers научился запускать GGUF-модели на Apple Silicon
Hugging Face сближает Transformers и llama.cpp. Первая реализация ориентирована на локальный запуск и пока имеет ограничения по оборудованию.

Редакционная иллюстрация создана с помощью ИИ. Изображение не является фотографией продукта или результатом его тестирования.
Что изменилось
22 сентября Hugging Face объявила об эффективном запуске GGUF-моделей через API Transformers. Для ускорения используются вычислительные ядра ggml, лежащие в основе llama.cpp. Первая цель команды: локальный запуск на Apple Silicon с архитектурой Qwen3.5.
GGUF хранит веса модели и служебные данные в одном файле. Квантизация уменьшает расход памяти, но выбор варианта всё равно зависит от модели, задачи и доступного оборудования.
Кому пригодится
Новость полезна разработчикам, которые хотят работать с GGUF в привычной среде Python и PyTorch: исследовать промежуточные состояния, проверять конверсию или сравнивать варианты модели. Для обычного локального чата авторы по-прежнему рекомендуют llama.cpp как специализированный движок.
На момент анонса требуется актуальная ветка Transformers и совместимые версии PyTorch и kernels. Быстрый путь с упакованными весами пока ориентирован на MPS. Если подходящее ядро недоступно, загрузка может перейти к распаковке весов и потребовать больше памяти. Это ограничение стоит проверить до обновления рабочего окружения.