№70

8 октября 2026

агенты · инструменты · данные

Поставьте дешёвую модель-фильтр перед дорогой LLM

Если коротко

Что даёт
быстрый и почти бесплатный ответ "подходит / не подходит" вместо того, чтобы гонять Gemini или Claude на каждую мелкую проверку.
Зачем
тяжёлая LLM нужна только на спорных случаях, а очевидные решает модель, которая просто выдаёт вероятность за доли секунды и не пишет ни слова текста.
Как сделать
заведите Cloudflare Workers AI, вызовите модель typesafe/jev с вашим текстом и вопросом да/нет, порог по вероятности в ответе решает, идти дальше в тяжёлую модель или нет.
Профит
по цифрам автора SAVAI - в 4 раза быстрее и в 8 раз дешевле Gemini на сортировке тем, нагрузка на Gemini упала на 75%; сама модель официально стоит $0,042 за 1 млн входных токенов, ответ бесплатный.
Где подвох
цифры SAVAI никто кроме автора не перепроверял; прямая регистрация на typesafe.ai закрыта с 22 сентября, доступ только через Cloudflare с предоплаченным балансом.

Что показано

Автор бота SAVAI (Telegram-бот для "сохранёнок": скидываешь рилсы, посты, статьи, он раскладывает по темам и отвечает на вопросы по базе) рассказывает, как ускорил фичу "карта знаний". Раньше каждый новый материал прогонялся через Gemini, чтобы понять, к какой теме он относится, теперь, короче, очевидные случаи ("топ-5 упражнений для спины точно не про ИИ") отсекает модель Jev, а Gemini подключается только когда Jev не уверена.

Почему это работает

Jev - не обычная LLM, а модель "System One" от TypeSafe AI: она не рассуждает и не генерирует текст, а отвечает на заранее размеченный закрытый вопрос (да/нет, выбор из списка, оценка по шкале) числом-вероятностью с confidence. Раз она не пишет токены, она в разы быстрее и дешевле любой болтливой модели, а вероятность на выходе сразу делит выборку на "точно да", "точно нет" и "непонятно", то есть в тяжёлую модель имеет смысл слать только последнее.

Модель не рассуждает, она мгновенно взвешивает вероятность - и именно поэтому дешёвый фильтр способен забрать себе большую часть решений, которые раньше шли в дорогую LLM.

Как повторить

  1. Заведите аккаунт Cloudflare, включите Workers AI и положите предоплаченный баланс в AI Gateway. Бесплатный лимит Workers AI на сторонние модели на Jev не действует, без баланса будет ошибка "Insufficient balance".
  2. Получите постоянный API-токен с правом на Workers AI. Часовой OAuth-токен wrangler для регулярных вызовов не годится, он протухает быстрее, чем успеете что-то посчитать в фоне.
  3. Опишите свою задачу как схему state (проверяемый контент) + questions: тип noul для да/нет, choice для выбора категории, score для оценки по шкале. Полный формат в документации Cloudflare.
  4. Вызовите модель:
curl https://api.cloudflare.com/client/v4/accounts/$CLOUDFLARE_ACCOUNT_ID/ai/run \
  --header "Authorization: Bearer $CLOUDFLARE_API_TOKEN" \
  --header "Content-Type: application/json" \
  --data '{
  "model": "typesafe/jev",
  "input": {
    "state": "текст или объект, который проверяете",
    "questions": {
      "fits_topic": {
        "type": "noul",
        "instructions": "Материал относится к теме X?",
        "criteria": { "true": "явно про тему X", "false": "не про тему X" }
      }
    }
  }
}'
  1. Возьмите noul/probabilities из ответа и задайте порог отсечения: например, p<0,3 - точно нет, p>0,7 - точно да, а между ними - эскалация в тяжёлую модель.
  2. Прежде чем ставить порог в проде, прогоните схему на паре десятков размеченных примеров из своей задачи. Формулировка вопроса решает больше, чем сама модель: на одинаковом наборе смена вопроса с общего на конкретный поднимала точность отсева с почти случайной до уверенной (восстановлено из независимой проверки на другой задаче, не из поста SAVAI, но механика та же).
  3. Подключите Jev как гейт перед вызовом Gemini/Claude/GPT: тяжёлая модель дёргается только на "непонятно", остальное решается за копейки.

Ссылки и ресурсы

  • Jev на Cloudflare AI docs - официальная страница модели: формат запроса и ответа, цена ($0,042 за 1 млн входных токенов, выход бесплатный, окно 32000 токенов); в посте SAVAI не упомянута вообще, найдена поиском.
  • Introducing System One Models & Jev, блог TypeSafe AI - официальный анонс модели и объяснение идеи "модель без рассуждений"; найден поиском.
  • @savaibot - сам бот, о котором пост; открывает Telegram, дальше работает по подписке, цену бот не показывает без запуска.

Проверочный прогон

Возьмите десяток заведомо "да" и десяток заведомо "нет" примеров из своей задачи, прогоните через Jev с одинаковым вопросом. Если вероятности чётко группируются на два полюса, у нуля и у единицы, порог ставить можно. Если ответы толпятся в середине, вопрос сформулирован слишком общо: перепишите его конкретнее и прогоните заново, прежде чем доверять фильтру продакшн-трафик.

Где это пригодится

Собственно, пригодится, если у вас есть классификатор или RAG, который на каждый новый кусок контента дёргает большую LLM только ради ответа "подходит / не подходит" или "к какой теме это ближе": теги контента, роутинг обращений, отсев дублей, модерация. Разница особенно чувствуется на объёме: сотни-тысячи проверок в день быстро превращаются в заметный счёт у Gemini или Claude, хотя решение "да/нет" им, по сути, не нужно.

У меня Jev уже стоит на разметке фактов в собственном втором мозге: с точной формулировкой вопроса точность отсева ушла далеко вперёд по сравнению с общей формулировкой того же вопроса. Получается, что почти всю работу делает не модель, а то, как вы вопрос ставите.

Оговорки

  • Все конкретные цифры поста (0,34 с против 1,39 с, $0,11 против $0,89 за 1000 запросов, 93 из 124 проверок) - собственные измерения автора SAVAI на его архитектуре и его вопросах, со стороны их не перепроверить, и на другой задаче они могут не повториться.
  • Кстати, сама модель Jev реальна и подтверждена официальной документацией Cloudflare и независимыми обзорами, это не выдумка и не громкая самореклама на пустом месте, а публичный продукт TypeSafe AI, вышедший 15.09.2026.
  • Прямая регистрация на typesafe.ai закрыта с 22 сентября, доступ только через Cloudflare Workers AI с предоплаченным балансом на AI Gateway.
  • Как именно устроена "карта знаний" SAVAI целиком, что до Jev считает Gemini и как строятся связи между темами, в посте не раскрыто: там описан только слой отсечения перед Gemini.
  • В кэше reader'а текст поста обрублен на середине фразы ("человек сохраняет сотню материалов про"), но полная версия сохранилась в собственной копии сообщения, потерь фактуры нет.

Больше подобного

Разбираю по находке в день и складываю сюда. Свежее и то, что до сайта не доехало, выходит в канале «Евдокимов как обычно».