Выбрать и запустить открытую LLM — задача, которая часто требует развёртывания инфраструктуры. Hugging Face продолжает упрощать этот процесс, добавляя сторонних провайдеров инференса прямо на свой хаб. Новым партнёром стал Baseten.
Hugging Face Hub теперь предлагает Baseten как провайдера инференса, расширяя возможности бессерверного инференса прямо со страниц моделей Hub. Интеграция уже есть в клиентских SDK для Python (huggingface_hub) и JavaScript (@huggingface/inference). Baseten поддерживает широкий спектр моделей, но сейчас с Hugging Face запущены разговорные LLM и модели генерации текста, включая Kimi K3, DeepSeek V4 Flash и GLM-5.2.
Пользователям доступны два режима работы с провайдерами инференса:
- Свой ключ — вызовы идут напрямую провайдеру, используя API ключ пользователя.
- Через Hugging Face — токен провайдера не нужен, оплата списывается с аккаунта Hugging Face. Настройки аккаунта позволяют установить ключи и задать предпочтительный порядок провайдеров. Модели, развёрнутые через Baseten, также интегрированы в популярные Agent Harnesses, такие как Pi и OpenCode.
Baseten стал третьим крупным провайдером инференса на Hugging Face Hub, присоединившись к DeepInfra и Scaleway. Это даёт инженерам больше выбора при работе с открытыми LLM. Сам Baseten использует vLLM, кеширование весов через Baseten Delivery Network (BDN), спекулятивное декодирование EAGLE3 и кеширование префиксов для эффективного развёртывания моделей.
Hugging Face продолжает укреплять свою роль как централизованной платформы для развёртывания открытых моделей, снимая с инженеров часть нагрузки по инфраструктуре. Теперь вместо самостоятельного развёртывания можно выбрать провайдера прямо на Hub и начать работу почти сразу. Вопрос лишь в том, насколько конкурентными будут цены Baseten при оплате через Hugging Face.