№25

25 сентября 2026

агенты · инструменты · данные

Мелкие решения в пайплайне отдайте модели, которая отвечает вероятностью, а ветку выберет ваш код

Если коротко

Что даёт
ответы на несколько закрытых вопросов про один текст за один вызов: да/нет с вероятностью, выбор из списка, оценка по шкале. Без абзаца рассуждений, который потом надо парсить.
Зачем
на развилках вроде «срочно ли», «спам ли», «кому отдать» LLM пишет объяснение, которое код выкидывает, а вы платите за каждый токен.
Как сделать
ключ в консоли TypeSafe, pip install typesafe-sdk, вопросы типов Noul, Choice, Score, а порог уверенности и действие ставите в своём if.
Профит
по их главной странице кейс стоит $0,000081 против $0,01388 у LLM: $81 против $13 880 за миллион. Заголовочные «200x быстрее, 400x дешевле» это потолок.
Где подвох
ответ гарантированно из вашего списка, но не гарантированно верный. Скорость и цену мерила сама компания на четырёх своих сценариях, доступ ранний.

Что показано

Карусель из девяти слайдов про Jev, первую «System One» модель стартапа TypeSafe AI. Вышла 15 сентября 2026, то есть на момент разбора ей девять дней. Автор сравнивает: обычная LLM на вопрос «тикет срочный?» сочиняет абзац токен за токеном, а Jev отдаёт решение и вероятность, вроде «да, 0.94». Дальше несколько вопросов за один проход, пороги уверенности в коде (выше 0.8 в автомат, ниже 0.6 человеку, между ними более сильная модель), оговорка «валидный не значит верный», схема с Jev вокруг LLM и матрица «if, LLM или Jev».

В подписи к посту одно слово «Jev?». Ссылки на доступ и кода API в карусели нет, поэтому шаги ниже собраны по документации TypeSafe, а не по слайдам.

Почему это работает

Обычная LLM даже на вопрос «да или нет» идёт через цикл генерации: токен за токеном, и вы платите временем и деньгами за текст, который код потом всё равно разбирает. Jev, по описанию TypeSafe, устроен иначе: модель не авторегрессионная, отвечает на все вопросы за один проход параллельно и обучена методом RLCD (обучение с подкреплением на калиброванные решения), чтобы вероятность что-то значила.

На входе state (текст или объект) и словарь вопросов трёх типов. Noul возвращает вероятность «да» от 0 до 1. Choice выбирает из списка до 255 вариантов и отдаёт вероятность каждого. Score оценивает по упорядоченной шкале.

Механику хорошо видно по открытым повторениям. Simple Jev от Featherless (Apache-2.0) берёт обычную открытую модель вроде Qwen или Gemma и считает ответ не генерацией, а сравнением вероятностей допустимых токенов после одного прохода по входу. Отсюда всё остальное: ответ не выходит за список, вопросы делят общий префикс входа и стоят почти ничего, вероятность получаете даром. (Как устроен внутри сам Jev, TypeSafe не раскрывает, так что это объяснение принципа, а не разбор их модели.)

Есть ещё confidence. Он считается из формы распределения: вся масса на одном варианте даёт 1.0, ровная россыпь даёт около нуля, для трёх вариантов формула (3 × максимум - 1) / 2. Получается второй рычаг: ответ говорит «что», уверенность говорит «можно ли действовать без человека». Порог вы ставите по цене ошибки: показать баланс можно и при 0.6, одобрить перевод только выше 0.85.

Модель отвечает вероятностью на закрытый вопрос, а порог и действие остаются в вашем if.
curl -X POST https://api.typesafe.ai/v1/systemone \
  -H "Authorization: Bearer $TYPESAFE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "state": "Help! My payouts have been failing for 3 days.",
    "model": "jev-latest",
    "questions": {
      "urgency": {"type": "noul", "instructions": "Does this message express urgency?"}
    }
  }'
  1. Поставьте SDK: pip install typesafe-sdk (Python 3.10+) или npm install @typesafe-ai/sdk. Спросите несколько вопросов за раз и разведите ветки. Код собран по примерам из доков и гайда, send_to_human и page_on_call это ваши функции:
from typesafe_sdk import Choice, Noul, TypeSafeClient

client = TypeSafeClient()  # ключ берёт из TYPESAFE_API_KEY

r = client.system_one(
    state={"ticket": "Deploy failed twice, customers see 500s. Need a fix and a refund for the downtime."},
    questions={
        "urgent": Noul(instructions="Message conveys urgency"),
        "team": Choice(
            instructions="Which team should handle this?",
            criteria={
                "engineering": "Outage, bug or deploy problem",
                "billing": "Payments, invoices, refunds only",
                "other": "Anything else",
            },
        ),
        "refund": Noul(instructions="The customer asks for a refund"),
    },
)

team = r.answers["team"]
if team.confidence < 0.6:
    send_to_human()
elif r.answers["urgent"].noul > 0.8 and team.choice == "engineering":
    page_on_call()
  1. Пороги начните с ориентиров из документации TypeSafe: ниже 0.6 уверенности это человеку, для денег и необратимых действий выше 0.85. Свои цифры подберёте на наборе из шага 2.
  2. Если нужен Jev вокруг LLM, как на слайде 8: перед вызовом выбрать модель через Choice, перед вызовом инструмента получить вердикт «выполнить, отклонить, спросить», после него проверить результат. Вердикт по инструментам есть в документации Pydantic AI: команда оболочки агента, ответы run, reject, ask, модель typesafe:jev-latest, установка pip install "pydantic-ai-slim[typesafe]". Полный семишаговый цикл со слайда я в документации не нашёл, это идея автора.

Если ключа нет:

  • Cloudflare Workers AI: модель typesafe/jev, запрос POST https://api.cloudflare.com/client/v4/accounts/$CLOUDFLARE_ACCOUNT_ID/ai/run, в теле model и input с теми же state и questions. Ограничений доступа в доке нет, цена в дашборде Cloudflare. Не запускал.
  • Открытые повторения того же интерфейса: Simple Jev (Featherless, Apache-2.0, есть публичное демо с потолком 2k контекста и 2 запроса в секунду) и Von (Apache-2.0, ModernBERT-Large, заявляет совместимость с /v1/systemone). Сравнения с Jev они опубликовали сами, независимой проверки не видел, ни одно не запускал.

Ссылки и ресурсы

  • Пост в Instagram - исходная карусель, 9 слайдов; слайды читал глазами через браузер, страница для reader отдаёт только первый; бесплатно.
  • ffckteam.com - сайт автора («Fuck Teambuilding», курсы и материалы), адрес стоит в подвале каждого слайда; про Jev на главной ничего нет; часть курсов бесплатная, часть по подписке.
  • TypeSafe AI - главная страница разработчика; там цена $42 за миллиард входных токенов и заголовок «193.6x быстрее, 444.6x дешевле»; выход бесплатный.
  • Блог: Introducing System One Models & Jev - первоисточник цифр и оговорок про их замеры; нашлось по ссылке «proof» на главной.
  • Quick start - эндпоинт https://api.typesafe.ai/v1/systemone, пример curl и Python; эндпоинт без ключа отвечает 403 с внятной ошибкой, значит жив.
  • Ключи API в консоли - страница ведёт на вход; регистрацию не проходил, условия допуска не знаю.
  • Confidence и Confidence-gated routing - как считается уверенность и какие пороги советует документация; бесплатно.
  • Кукбук Skill suggestion - подбор одного скилла из каталога в 182 штуки двумя запросами; на их тесте ошибочных загрузок стало 7,3% вместо 16,8%, но запросы сгенерировала модель по описаниям скиллов, то есть легче живых.
  • PyPI typesafe-sdk и npm @typesafe-ai/sdk - SDK; существование и версии (0.7.1 и 0.6.0) сверил по реестрам; бесплатно.
  • Pydantic AI: TypeSafe - подключение через pydantic-ai-slim[typesafe], пример вердикта для команд агента.
  • Cloudflare: typesafe/jev - тот же вызов через Workers AI; цена в дашборде Cloudflare, не смотрел.
  • KDnuggets: What Everyone Is Getting Wrong About Jev - трезвый разбор, где Jev уже, чем звучит заголовок.
  • dev.to: How to Use Jev - сторонний практический гайд со списком отказов; ~68% совпадения с эталоном оттуда я в первоисточнике не нашёл, считайте неподтверждённым.
  • Wikipedia: Jev (AI model)) - дата релиза, основатели, раунд $40 млн под руководством DCVC.
  • Simple Jev (Featherless AI) и Von - открытые повторения интерфейса; Apache-2.0; про Simple Jev прочитал только превью статьи.

Проверочный прогон

Запустите curl из шага 4. Правильный результат: в answers.urgency.noul число вероятности, без текста рассуждений, и счётчик токенов в usage. В примере Cloudflare на тот же текст вышло 0.95. Подмените текст на «Thanks, everything works now»: число должно упасть заметно ниже (порядок ожидаемых значений мой, в доке его нет). Если у обоих около 0.5, вопрос сформулирован расплывчато, перепишите instructions и добавьте criteria.

Потом набор из 50-100 примеров. Посчитайте, сколько ушло в автомат при пороге 0.85 и сколько из этого автомата неверно. Годится, если ошибок меньше, чем допускает цена ошибки в вашем деле. Неудача бывает двух видов. Уверенные промахи: критерии пересекаются или вопрос читается буквально, чинится формулировкой. Почти всё ниже порога: вопрос не для Jev, отдайте его обычной LLM.

Отдельно замерьте время ответа с вашего сервера. 70-500 мс заявлены по замерам с ноутбуков на Западном побережье США, до вас сеть добавит своё.

Где это пригодится

Если у вас есть конвейер, где одна и та же мелкая оценка повторяется тысячи раз, приём ложится прямо туда: тикеты в поддержку, квалификация лидов, модерация, выбор модели или скилла под запрос, шлюз перед опасными командами агента. Если развилок мало, каждая уникальна или нужно объяснение человеческим языком, берите обычную LLM: экономии не будет, а вероятность вы не используете. Цифры про «200x» интересны только на объёме.

Куда заберу я: подбор скилла из каталога под запрос (у TypeSafe есть готовый рецепт на 182 скилла) и сортировка входящих в боте. Руками пока не гонял: проверил докс, пакеты и живой эндпоинт, вызова с ключом не делал.

Оговорки

  • Цифры 193x и 444x. Их посчитала команда самой TypeSafe на четырёх своих сценариях против GPT-6 Astra и Fable 5.1. В блоге они сами пишут, что цифры делали люди из их команды, так что «some bias could exist», и что это верхний край реальных выигрышей. Пара цифр с их же главной ($0,000081 и 0,114 с против $0,01388 и 8,566 с) даёт около ×171 по цене и ×75 по скорости, а как из этого вышли 193 и 444, страница не объясняет. Автор в подзаголовке честно пишет «по их же замерам», но 200x и 400x всё равно вынес в крючок.
  • Точности в посте нет совсем. Слайды молчат, насколько Jev вообще угадывает. Вторичные источники называют около 68% совпадения с эталоном на бенчмарке компании, первоисточник этой цифры я не нашёл.
  • Слайд 2 упрощён. Ответ вида "срочно": "да", "уверенность": 0.94 нарисован для наглядности. Настоящий Noul возвращает одно число вероятности (в примере Cloudflare 0.95), слово «да» получаете вы сами порогом. Пример со слайда 6 (биллинг 0.52, поддержка 0.46) тоже иллюстрация, живого прогона за ним нет.
  • «Не галлюцинирует». Автор сам поправляет это на слайде 7, и правильно: схема гарантирует, что ответ будет из списка, а не что он верный. Кстати, при неверном ярлыке «биллинг» у бага со входом возврат уйдёт не тому клиенту, никакая схема этого не поймает.
  • Доступ. Блог пишет про ранний доступ и вейтлист, квикстарт про очередь не упоминает, регистрацию я не проходил. Модели девять дней от релиза, jev-latest это скользящий алиас, при тюнинге порогов закрепляйте версию (в доке пример jev-1.13.0), у npm-пакета версия 0.6.0.
  • Пределы. Свободного текста нет, вариантов в одном вопросе до 255. Лимит контекста в источниках расходится: 32 тысячи токенов у Cloudflare, 64 тысячи в стороннем гайде. Тот же гайд предупреждает, что модель читает вопрос буквально, плохо считает и путается в датах. Это слова стороннего автора, сам не проверял.
  • Схема со слайда 8 (Jev выбирает модель, одобряет вызов, проверяет результат) это идея автора. Каждый лишний вызов Jev добавляет задержку и ещё одно вероятностное суждение, которое тоже может ошибиться, а текст пользователя внутри state может влиять на решение.
  • Бесплатный аналог из комментариев. Комментатор не назвал какой, но открытые повторения существуют (Simple Jev, Von и другие), лицензия Apache-2.0. Их сравнения с Jev самопальные, я ничего не запускал. Идея про маршрутизацию субагентов Claude из соседнего комментария того же типа: разумная, руками не проверена.
  • Данные. В state уходят ваши тексты на сторонний американский сервис. Если там персональные данные клиентов или записи, сначала прочитайте условия TypeSafe и решите, можно ли.

Больше подобного

Разбираю по находке в день и складываю сюда. Свежее и то, что до сайта не доехало, выходит в канале «Евдокимов как обычно».