Полный голосовой агент — слух, рассуждение, речь — обычно живёт в облаке. Инженер ElevenLabs уместил его целиком в Raspberry Pi 4: ни одного облачного вызова.
Anthropic выпустила Claude Haiku 5.5 (claude-haiku-5-5), свою самую быструю и экономичную модель, которая теперь может обрабатывать до миллиона токенов контекста. Это открывает новые возможности для автоматизации задач, требующих высокой пропускной способности и минимальной задержки.
Ключевым нововведением является окно контекста в 1 миллион токенов и максимальный объем вывода в 128 тысяч токенов. Это позволяет модели работать с крупными документами и сложными запросами, сохраняя при этом высокую скорость.
Модель также получила функцию адаптивного мышления (adaptive thinking) с параметром effort, которая позволяет ей динамически регулировать глубину обработки запроса. Эта функция включена по умолчанию и может проявляться в виде блоков thinking в ответе.
Claude Haiku 5.5 оптимизирована для высокообъемных и чувствительных к задержкам задач, таких как классификация, извлечение информации и маршрутизация. Модель доступна через:
- Claude API
- Claude in Amazon Bedrock
- Claude Platform on AWS
- Claude on Google Cloud
- Claude in Microsoft Foundry
Стоимость ввода начинается от $0.10 за миллион токенов для промптов до 100 000 токенов и $0.50 за миллион токенов для промптов свыше 100 000 токенов, что делает Haiku 5.5 самой доступной моделью Anthropic для работы с большими объемами данных. Однако разработчикам следует учесть, что код, написанный для Haiku 4.5, может потребовать доработки. Из-за нового токенизатора один и тот же текст может приводить к примерно на 30% большему количеству токенов на Haiku 5.5 по сравнению с предыдущими версиями. Ручное расширенное мышление (budget_tokens) также приводит к ошибке 400.
Claude Haiku 5.5 предлагает сочетание скорости, доступности и для этого класса моделей объема контекста, что делает его инструментом для массовых и критичных по времени операций. Однако Anthropic не предоставила независимых бенчмарков производительности или сравнений скорости с предыдущими версиями или конкурентами при работе с 1M токенов, что затрудняет объективную оценку реального прироста.