Ко всем новостям
ФункцииЗакреплено

Модель Hy3 в пуле tencent, аптайм по времени и график активности

Добавили рассуждающую модель Hy3 от Tencent: 5 ₽ за миллион входных токенов, 20 ₽ за выходные, 2.5 ₽ за кэш, контекст 262 тысячи токенов. Заодно переделали блок доступности: теперь это график по времени с выбором периода, а на карточках моделей видно аптайм за час и число запросов за сутки.

Два обновления: новая модель и честные графики.

Hy3 от Tencent

В каталоге появилась рассуждающая модель hy3@tencent. Она умеет стриминг, вызов функций и отдаёт ход рассуждений отдельным полем reasoning_content, так что видно, как она пришла к ответу.

ЧтоСколько
Входные токены5 ₽ за 1M
Выходные токены20 ₽ за 1M
Кэшированный промпт2.5 ₽ за 1M
Контекст262 144 токена

Проверили контекст не по документации, а руками: спрятали кодовое слово в самом начале промпта на 200 тысяч символов, модель его достала. Ничего по дороге не обрезается.

curl https://api.clavis.to/v1/chat/completions \
  -H "Authorization: Bearer $CLAVIS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "hy3@tencent",
    "messages": [{"role": "user", "content": "Привет"}]
  }'

Кэширование

У поставщика кэша промптов нет вообще, поэтому мы сделали его на своей стороне. Если тот же самый запрос приходит повторно, ответ отдаётся из нашего кэша: без обращения к поставщику и по ставке 2.5 ₽ вместо 5 ₽ за входные токены. На замере повтор пришёл за 0.14 секунды против 8.2 секунды у первого запроса.

Важная оговорка: это кэш по точному совпадению запроса, а не по общему началу диалога. В обычной переписке каждое новое сообщение меняет запрос целиком, поэтому там кэш не сработает. Он полезен на повторных прогонах, ретраях и одинаковых пакетных запросах.

Что стоит знать

Ёмкость у этой модели общая и не резиновая, а счётчик токенов оценочный: поставщик не отдаёт точных цифр, поэтому мы считаем их приближённо. Для критичных задач берите модели с SLA, для экспериментов и фоновой работы Hy3 подходит хорошо.

Доступность теперь по времени

Раньше в блоке доступности рисовались полоски, и доля сбоев красилась красным с правого края. Выглядело так, будто модель работала весь месяц, а сломалась только что, хотя на самом деле сбои могли быть неделю назад. Это вводило в заблуждение, и мы это убрали.

Теперь там настоящий график по времени. Сбой виден там, где он был. Период переключается: час, сутки, 30 дней и всё время. Промежутки, когда запросов не было, мы не измеряем и не закрашиваем зелёным: нечего измерять, значит и показывать нечего.

В списке моделей на карточке теперь два значка: аптайм за последний час (если в этот час были запросы) и количество запросов за сутки. Час честнее отвечает на вопрос «работает ли она прямо сейчас», чем усреднение за месяц.

График активности

На странице каждой модели появился блок «Активность»: объём токенов и запросов за 30 дней, сразу по всем пулам этой модели. Переключается между токенами (промпт и ответ отдельно) и числом запросов. Считаются только успешные запросы, чтобы неудачный день не выглядел как всплеск нагрузки.

Коротко

Hy3 доступна прямо сейчас: страница модели или общий каталог. Аптайм и активность обновились у всех моделей, ничего включать не нужно.