Модель Hy3 в пуле tencent, аптайм по времени и график активности
Добавили рассуждающую модель Hy3 от Tencent: 5 ₽ за миллион входных токенов, 20 ₽ за выходные, 2.5 ₽ за кэш, контекст 262 тысячи токенов. Заодно переделали блок доступности: теперь это график по времени с выбором периода, а на карточках моделей видно аптайм за час и число запросов за сутки.
Два обновления: новая модель и честные графики.
Hy3 от Tencent
В каталоге появилась рассуждающая модель hy3@tencent. Она умеет стриминг, вызов функций и отдаёт ход рассуждений отдельным полем reasoning_content, так что видно, как она пришла к ответу.
| Что | Сколько |
|---|---|
| Входные токены | 5 ₽ за 1M |
| Выходные токены | 20 ₽ за 1M |
| Кэшированный промпт | 2.5 ₽ за 1M |
| Контекст | 262 144 токена |
Проверили контекст не по документации, а руками: спрятали кодовое слово в самом начале промпта на 200 тысяч символов, модель его достала. Ничего по дороге не обрезается.
curl https://api.clavis.to/v1/chat/completions \
-H "Authorization: Bearer $CLAVIS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "hy3@tencent",
"messages": [{"role": "user", "content": "Привет"}]
}'
Кэширование
У поставщика кэша промптов нет вообще, поэтому мы сделали его на своей стороне. Если тот же самый запрос приходит повторно, ответ отдаётся из нашего кэша: без обращения к поставщику и по ставке 2.5 ₽ вместо 5 ₽ за входные токены. На замере повтор пришёл за 0.14 секунды против 8.2 секунды у первого запроса.
Важная оговорка: это кэш по точному совпадению запроса, а не по общему началу диалога. В обычной переписке каждое новое сообщение меняет запрос целиком, поэтому там кэш не сработает. Он полезен на повторных прогонах, ретраях и одинаковых пакетных запросах.
Что стоит знать
Ёмкость у этой модели общая и не резиновая, а счётчик токенов оценочный: поставщик не отдаёт точных цифр, поэтому мы считаем их приближённо. Для критичных задач берите модели с SLA, для экспериментов и фоновой работы Hy3 подходит хорошо.
Доступность теперь по времени
Раньше в блоке доступности рисовались полоски, и доля сбоев красилась красным с правого края. Выглядело так, будто модель работала весь месяц, а сломалась только что, хотя на самом деле сбои могли быть неделю назад. Это вводило в заблуждение, и мы это убрали.
Теперь там настоящий график по времени. Сбой виден там, где он был. Период переключается: час, сутки, 30 дней и всё время. Промежутки, когда запросов не было, мы не измеряем и не закрашиваем зелёным: нечего измерять, значит и показывать нечего.
В списке моделей на карточке теперь два значка: аптайм за последний час (если в этот час были запросы) и количество запросов за сутки. Час честнее отвечает на вопрос «работает ли она прямо сейчас», чем усреднение за месяц.
График активности
На странице каждой модели появился блок «Активность»: объём токенов и запросов за 30 дней, сразу по всем пулам этой модели. Переключается между токенами (промпт и ответ отдельно) и числом запросов. Считаются только успешные запросы, чтобы неудачный день не выглядел как всплеск нагрузки.
Коротко
Hy3 доступна прямо сейчас: страница модели или общий каталог. Аптайм и активность обновились у всех моделей, ничего включать не нужно.