262 144 токена контекста — это огромный объём данных, достаточный для анализа больших документов или целых кодовых баз. OpenRouter расширил свою линейку, добавив несколько моделей с таким контекстом, включая бесплатные варианты и первую крупную диффузионную LLM.
Inception: Mercury 2.5 теперь доступна на OpenRouter и предлагает 260 000 токенов контекста. Разработчик Inception Labs заявляет о 40%-ном росте интеллекта по сравнению с предыдущей версией Mercury 2. По данным компании, это "самая производственная модель" и "крупнейшая диффузионная языковая модель", обученная на сегодняшний день. Модель достигает скорости в 1107 токенов в секунду на NVIDIA GPU. На старте цена составляет $0.04 за миллион входных токенов и $0.15 за миллион выходных (со скидкой 80%). Mercury 2.5 поддерживает настраиваемое рассуждение, параллельные вызовы инструментов и вывод JSON по схеме.
Nex AGI также представила на OpenRouter две модели с контекстным окном в 262 144 токена: Nex-N2.5-Mini и Nex-N2.5-Pro. Обе модели доступны бесплатно. Nex-N2.5-Mini работает только с текстом, а Nex-N2.5-Pro является мультимодальной, принимая на вход текст и изображения, а выдавая текст.
OpenRouter выступает в роли единого API-шлюза, который нормализует схемы запросов и ответов для различных моделей и провайдеров. Это делает их совместимыми с OpenAI Chat API и упрощает интеграцию для разработчиков. Подобные большие контекстные окна уже предлагают флагманы рынка, такие как Gemini 1.5 Pro и Claude 3 Opus.
Доступность моделей с контекстом в четверть миллиона токенов, особенно бесплатных и с новой архитектурой, снимает часть барьеров для разработки с большими данными. OpenRouter делает эти технологии массовее, но заявленную конкурентоспособность Mercury 2.5 с флагманами рынка предстоит проверить сторонним бенчмаркам.