Что показано
Автор бота SAVAI (Telegram-бот для "сохранёнок": скидываешь рилсы, посты, статьи, он раскладывает по темам и отвечает на вопросы по базе) рассказывает, как ускорил фичу "карта знаний". Раньше каждый новый материал прогонялся через Gemini, чтобы понять, к какой теме он относится, теперь, короче, очевидные случаи ("топ-5 упражнений для спины точно не про ИИ") отсекает модель Jev, а Gemini подключается только когда Jev не уверена.
Почему это работает
Jev - не обычная LLM, а модель "System One" от TypeSafe AI: она не рассуждает и не генерирует текст, а отвечает на заранее размеченный закрытый вопрос (да/нет, выбор из списка, оценка по шкале) числом-вероятностью с confidence. Раз она не пишет токены, она в разы быстрее и дешевле любой болтливой модели, а вероятность на выходе сразу делит выборку на "точно да", "точно нет" и "непонятно", то есть в тяжёлую модель имеет смысл слать только последнее.
Модель не рассуждает, она мгновенно взвешивает вероятность - и именно поэтому дешёвый фильтр способен забрать себе большую часть решений, которые раньше шли в дорогую LLM.
Как повторить
- Заведите аккаунт Cloudflare, включите Workers AI и положите предоплаченный баланс в AI Gateway. Бесплатный лимит Workers AI на сторонние модели на Jev не действует, без баланса будет ошибка "Insufficient balance".
- Получите постоянный API-токен с правом на Workers AI. Часовой OAuth-токен
wranglerдля регулярных вызовов не годится, он протухает быстрее, чем успеете что-то посчитать в фоне. - Опишите свою задачу как схему
state(проверяемый контент) +questions: типnoulдля да/нет,choiceдля выбора категории,scoreдля оценки по шкале. Полный формат в документации Cloudflare. - Вызовите модель:
curl https://api.cloudflare.com/client/v4/accounts/$CLOUDFLARE_ACCOUNT_ID/ai/run \
--header "Authorization: Bearer $CLOUDFLARE_API_TOKEN" \
--header "Content-Type: application/json" \
--data '{
"model": "typesafe/jev",
"input": {
"state": "текст или объект, который проверяете",
"questions": {
"fits_topic": {
"type": "noul",
"instructions": "Материал относится к теме X?",
"criteria": { "true": "явно про тему X", "false": "не про тему X" }
}
}
}
}'- Возьмите
noul/probabilitiesиз ответа и задайте порог отсечения: например, p<0,3 - точно нет, p>0,7 - точно да, а между ними - эскалация в тяжёлую модель. - Прежде чем ставить порог в проде, прогоните схему на паре десятков размеченных примеров из своей задачи. Формулировка вопроса решает больше, чем сама модель: на одинаковом наборе смена вопроса с общего на конкретный поднимала точность отсева с почти случайной до уверенной (восстановлено из независимой проверки на другой задаче, не из поста SAVAI, но механика та же).
- Подключите Jev как гейт перед вызовом Gemini/Claude/GPT: тяжёлая модель дёргается только на "непонятно", остальное решается за копейки.
Ссылки и ресурсы
- Jev на Cloudflare AI docs - официальная страница модели: формат запроса и ответа, цена ($0,042 за 1 млн входных токенов, выход бесплатный, окно 32000 токенов); в посте SAVAI не упомянута вообще, найдена поиском.
- Introducing System One Models & Jev, блог TypeSafe AI - официальный анонс модели и объяснение идеи "модель без рассуждений"; найден поиском.
- @savaibot - сам бот, о котором пост; открывает Telegram, дальше работает по подписке, цену бот не показывает без запуска.
Проверочный прогон
Возьмите десяток заведомо "да" и десяток заведомо "нет" примеров из своей задачи, прогоните через Jev с одинаковым вопросом. Если вероятности чётко группируются на два полюса, у нуля и у единицы, порог ставить можно. Если ответы толпятся в середине, вопрос сформулирован слишком общо: перепишите его конкретнее и прогоните заново, прежде чем доверять фильтру продакшн-трафик.
Где это пригодится
Собственно, пригодится, если у вас есть классификатор или RAG, который на каждый новый кусок контента дёргает большую LLM только ради ответа "подходит / не подходит" или "к какой теме это ближе": теги контента, роутинг обращений, отсев дублей, модерация. Разница особенно чувствуется на объёме: сотни-тысячи проверок в день быстро превращаются в заметный счёт у Gemini или Claude, хотя решение "да/нет" им, по сути, не нужно.
У меня Jev уже стоит на разметке фактов в собственном втором мозге: с точной формулировкой вопроса точность отсева ушла далеко вперёд по сравнению с общей формулировкой того же вопроса. Получается, что почти всю работу делает не модель, а то, как вы вопрос ставите.
Оговорки
- Все конкретные цифры поста (0,34 с против 1,39 с, $0,11 против $0,89 за 1000 запросов, 93 из 124 проверок) - собственные измерения автора SAVAI на его архитектуре и его вопросах, со стороны их не перепроверить, и на другой задаче они могут не повториться.
- Кстати, сама модель Jev реальна и подтверждена официальной документацией Cloudflare и независимыми обзорами, это не выдумка и не громкая самореклама на пустом месте, а публичный продукт TypeSafe AI, вышедший 15.09.2026.
- Прямая регистрация на typesafe.ai закрыта с 22 сентября, доступ только через Cloudflare Workers AI с предоплаченным балансом на AI Gateway.
- Как именно устроена "карта знаний" SAVAI целиком, что до Jev считает Gemini и как строятся связи между темами, в посте не раскрыто: там описан только слой отсечения перед Gemini.
- В кэше reader'а текст поста обрублен на середине фразы ("человек сохраняет сотню материалов про"), но полная версия сохранилась в собственной копии сообщения, потерь фактуры нет.