Определить, какая модель эмбеддингов лучше всего подходит для вашей системы поиска — будь то RAG, поиск кода или что-то ещё — непросто. OpenRouter, как агрегатор API, выпустил практическое руководство, которое помогает инженерам сориентироваться в компромиссах между ценой, контекстом и спецификой задачи, основываясь на живых тестах десятков моделей.
Эмбеддинг-модели (модели векторизации текста) превращают входные данные в числовые векторы, размещая близкие по смыслу элементы рядом. Это позволяет поисковым системам находить информацию по значению, а не по точному совпадению слов. Оптимальный выбор такой модели зависит от множества факторов, включая тип материала для поиска, размер вектора, длину контекста, наличие публичных весов и стоимость.
Для составления рекомендаций OpenRouter протестировал 37 моделей из своего каталога, отправляя живые запросы через собственный API. Проверка, завершённая 11 сентября 2026 года, охватывала поведение запросов и ответов, включая пакетную обработку, настраиваемые размеры векторов, а также обработку изображений и их комбинаций с текстом. При этом OpenRouter подчёркивает, что их тесты подтверждают API-совместимость, но не измеряют качество извлечения информации: для окончательного выбора необходимо самостоятельно сравнивать кандидатов на размеченных данных вашего приложения.
OpenRouter предлагает следующие рекомендации по моделям эмбеддингов для различных сценариев:
- RAG на английском языке —
openai/text-embedding-3-small. Отличается низкой ценой, контекстом в 8192 токена и возможностью регулировать выходные размеры векторов. - Входы длиннее 8192 токенов —
voyageai/voyage-4-large. Имеет контекстное окно в 32000 токенов, четыре настраиваемых размера векторов и совместимость с другими моделями серии Voyage 4. - Мультиязычный поиск с открытыми весами —
qwen/qwen3-embedding-8b. Поддерживает более 100 языков, имеет контекст в 32768 токенов и открытые веса. - Поиск кода —
voyageai/voyage-code-4. Разработана специально для извлечения кода и задач кодирующих агентов. - Поиск текста и изображений —
google/gemini-embedding-2. Размещает текст и изображения в одном пространстве векторов. Альтернатива —voyageai/voyage-multimodal-3.5. - Самый дешёвый платный вариант (только текст) —
perplexity/pplx-embed-v1-0.6b. Цена составляет $0.004 за миллион входных токенов при контексте в 32000 токенов. - Бесплатные эмбеддинги (только текст) —
nvidia/nemotron-3-embed-1b:free. Бесплатный маршрут с контекстом в 32768 токенов.
Размер выходного вектора напрямую влияет на объём хранилища и стоимость поиска. Так, openai/text-embedding-3-small по умолчанию выдаёт 1536 значений, но позволяет уменьшить их до 256, сокращая расходы на хранение и поиск, хотя это может снизить качество извлечения. Модели Voyage 4 (Large, 4, Lite) предлагают контекст в 32000 токенов и совместимость эмбеддингов внутри серии, что позволяет менять модель без переиндексации. Qwen3-embedding-8b, обладая открытыми весами и поддержкой более 100 языков, выдаёт 4096 значений, что требует в четыре раза больше хранилища по сравнению с 1024-значными векторами. Её оценка в 70.58 по MTEB (на 5 июня 2025) является показателем, но требует проверки на ваших данных. Мультимодальные модели, такие как google/gemini-embedding-2 и voyageai/voyage-multimodal-3.5, используют разные векторные пространства, поэтому выбор одной из них критичен до начала индексации.
Руководство OpenRouter — это полезная отправная точка, но окончательный выбор всегда должен опираться на собственные тесты с реальными данными приложения. API-совместимость, подтверждённая платформой, не гарантирует оптимального качества извлечения для вашей конкретной задачи.