Что показано
Карусель из девяти слайдов про Jev, первую «System One» модель стартапа TypeSafe AI. Вышла 15 сентября 2026, то есть на момент разбора ей девять дней. Автор сравнивает: обычная LLM на вопрос «тикет срочный?» сочиняет абзац токен за токеном, а Jev отдаёт решение и вероятность, вроде «да, 0.94». Дальше несколько вопросов за один проход, пороги уверенности в коде (выше 0.8 в автомат, ниже 0.6 человеку, между ними более сильная модель), оговорка «валидный не значит верный», схема с Jev вокруг LLM и матрица «if, LLM или Jev».
В подписи к посту одно слово «Jev?». Ссылки на доступ и кода API в карусели нет, поэтому шаги ниже собраны по документации TypeSafe, а не по слайдам.
Почему это работает
Обычная LLM даже на вопрос «да или нет» идёт через цикл генерации: токен за токеном, и вы платите временем и деньгами за текст, который код потом всё равно разбирает. Jev, по описанию TypeSafe, устроен иначе: модель не авторегрессионная, отвечает на все вопросы за один проход параллельно и обучена методом RLCD (обучение с подкреплением на калиброванные решения), чтобы вероятность что-то значила.
На входе state (текст или объект) и словарь вопросов трёх типов. Noul возвращает вероятность «да» от 0 до 1. Choice выбирает из списка до 255 вариантов и отдаёт вероятность каждого. Score оценивает по упорядоченной шкале.
Механику хорошо видно по открытым повторениям. Simple Jev от Featherless (Apache-2.0) берёт обычную открытую модель вроде Qwen или Gemma и считает ответ не генерацией, а сравнением вероятностей допустимых токенов после одного прохода по входу. Отсюда всё остальное: ответ не выходит за список, вопросы делят общий префикс входа и стоят почти ничего, вероятность получаете даром. (Как устроен внутри сам Jev, TypeSafe не раскрывает, так что это объяснение принципа, а не разбор их модели.)
Есть ещё confidence. Он считается из формы распределения: вся масса на одном варианте даёт 1.0, ровная россыпь даёт около нуля, для трёх вариантов формула (3 × максимум - 1) / 2. Получается второй рычаг: ответ говорит «что», уверенность говорит «можно ли действовать без человека». Порог вы ставите по цене ошибки: показать баланс можно и при 0.6, одобрить перевод только выше 0.85.
Модель отвечает вероятностью на закрытый вопрос, а порог и действие остаются в вашем if.
curl -X POST https://api.typesafe.ai/v1/systemone \
-H "Authorization: Bearer $TYPESAFE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"state": "Help! My payouts have been failing for 3 days.",
"model": "jev-latest",
"questions": {
"urgency": {"type": "noul", "instructions": "Does this message express urgency?"}
}
}'- Поставьте SDK:
pip install typesafe-sdk(Python 3.10+) илиnpm install @typesafe-ai/sdk. Спросите несколько вопросов за раз и разведите ветки. Код собран по примерам из доков и гайда,send_to_humanиpage_on_callэто ваши функции:
from typesafe_sdk import Choice, Noul, TypeSafeClient
client = TypeSafeClient() # ключ берёт из TYPESAFE_API_KEY
r = client.system_one(
state={"ticket": "Deploy failed twice, customers see 500s. Need a fix and a refund for the downtime."},
questions={
"urgent": Noul(instructions="Message conveys urgency"),
"team": Choice(
instructions="Which team should handle this?",
criteria={
"engineering": "Outage, bug or deploy problem",
"billing": "Payments, invoices, refunds only",
"other": "Anything else",
},
),
"refund": Noul(instructions="The customer asks for a refund"),
},
)
team = r.answers["team"]
if team.confidence < 0.6:
send_to_human()
elif r.answers["urgent"].noul > 0.8 and team.choice == "engineering":
page_on_call()- Пороги начните с ориентиров из документации TypeSafe: ниже 0.6 уверенности это человеку, для денег и необратимых действий выше 0.85. Свои цифры подберёте на наборе из шага 2.
- Если нужен Jev вокруг LLM, как на слайде 8: перед вызовом выбрать модель через
Choice, перед вызовом инструмента получить вердикт «выполнить, отклонить, спросить», после него проверить результат. Вердикт по инструментам есть в документации Pydantic AI: команда оболочки агента, ответыrun,reject,ask, модельtypesafe:jev-latest, установкаpip install "pydantic-ai-slim[typesafe]". Полный семишаговый цикл со слайда я в документации не нашёл, это идея автора.
Если ключа нет:
- Cloudflare Workers AI: модель
typesafe/jev, запросPOST https://api.cloudflare.com/client/v4/accounts/$CLOUDFLARE_ACCOUNT_ID/ai/run, в телеmodelиinputс теми жеstateиquestions. Ограничений доступа в доке нет, цена в дашборде Cloudflare. Не запускал. - Открытые повторения того же интерфейса: Simple Jev (Featherless, Apache-2.0, есть публичное демо с потолком 2k контекста и 2 запроса в секунду) и Von (Apache-2.0, ModernBERT-Large, заявляет совместимость с
/v1/systemone). Сравнения с Jev они опубликовали сами, независимой проверки не видел, ни одно не запускал.
Ссылки и ресурсы
- Пост в Instagram - исходная карусель, 9 слайдов; слайды читал глазами через браузер, страница для reader отдаёт только первый; бесплатно.
- ffckteam.com - сайт автора («Fuck Teambuilding», курсы и материалы), адрес стоит в подвале каждого слайда; про Jev на главной ничего нет; часть курсов бесплатная, часть по подписке.
- TypeSafe AI - главная страница разработчика; там цена $42 за миллиард входных токенов и заголовок «193.6x быстрее, 444.6x дешевле»; выход бесплатный.
- Блог: Introducing System One Models & Jev - первоисточник цифр и оговорок про их замеры; нашлось по ссылке «proof» на главной.
- Quick start - эндпоинт
https://api.typesafe.ai/v1/systemone, пример curl и Python; эндпоинт без ключа отвечает 403 с внятной ошибкой, значит жив. - Ключи API в консоли - страница ведёт на вход; регистрацию не проходил, условия допуска не знаю.
- Confidence и Confidence-gated routing - как считается уверенность и какие пороги советует документация; бесплатно.
- Кукбук Skill suggestion - подбор одного скилла из каталога в 182 штуки двумя запросами; на их тесте ошибочных загрузок стало 7,3% вместо 16,8%, но запросы сгенерировала модель по описаниям скиллов, то есть легче живых.
- PyPI typesafe-sdk и npm @typesafe-ai/sdk - SDK; существование и версии (0.7.1 и 0.6.0) сверил по реестрам; бесплатно.
- Pydantic AI: TypeSafe - подключение через
pydantic-ai-slim[typesafe], пример вердикта для команд агента. - Cloudflare: typesafe/jev - тот же вызов через Workers AI; цена в дашборде Cloudflare, не смотрел.
- KDnuggets: What Everyone Is Getting Wrong About Jev - трезвый разбор, где Jev уже, чем звучит заголовок.
- dev.to: How to Use Jev - сторонний практический гайд со списком отказов; ~68% совпадения с эталоном оттуда я в первоисточнике не нашёл, считайте неподтверждённым.
- Wikipedia: Jev (AI model)) - дата релиза, основатели, раунд $40 млн под руководством DCVC.
- Simple Jev (Featherless AI) и Von - открытые повторения интерфейса; Apache-2.0; про Simple Jev прочитал только превью статьи.
Проверочный прогон
Запустите curl из шага 4. Правильный результат: в answers.urgency.noul число вероятности, без текста рассуждений, и счётчик токенов в usage. В примере Cloudflare на тот же текст вышло 0.95. Подмените текст на «Thanks, everything works now»: число должно упасть заметно ниже (порядок ожидаемых значений мой, в доке его нет). Если у обоих около 0.5, вопрос сформулирован расплывчато, перепишите instructions и добавьте criteria.
Потом набор из 50-100 примеров. Посчитайте, сколько ушло в автомат при пороге 0.85 и сколько из этого автомата неверно. Годится, если ошибок меньше, чем допускает цена ошибки в вашем деле. Неудача бывает двух видов. Уверенные промахи: критерии пересекаются или вопрос читается буквально, чинится формулировкой. Почти всё ниже порога: вопрос не для Jev, отдайте его обычной LLM.
Отдельно замерьте время ответа с вашего сервера. 70-500 мс заявлены по замерам с ноутбуков на Западном побережье США, до вас сеть добавит своё.
Где это пригодится
Если у вас есть конвейер, где одна и та же мелкая оценка повторяется тысячи раз, приём ложится прямо туда: тикеты в поддержку, квалификация лидов, модерация, выбор модели или скилла под запрос, шлюз перед опасными командами агента. Если развилок мало, каждая уникальна или нужно объяснение человеческим языком, берите обычную LLM: экономии не будет, а вероятность вы не используете. Цифры про «200x» интересны только на объёме.
Куда заберу я: подбор скилла из каталога под запрос (у TypeSafe есть готовый рецепт на 182 скилла) и сортировка входящих в боте. Руками пока не гонял: проверил докс, пакеты и живой эндпоинт, вызова с ключом не делал.
Оговорки
- Цифры 193x и 444x. Их посчитала команда самой TypeSafe на четырёх своих сценариях против GPT-6 Astra и Fable 5.1. В блоге они сами пишут, что цифры делали люди из их команды, так что «some bias could exist», и что это верхний край реальных выигрышей. Пара цифр с их же главной ($0,000081 и 0,114 с против $0,01388 и 8,566 с) даёт около ×171 по цене и ×75 по скорости, а как из этого вышли 193 и 444, страница не объясняет. Автор в подзаголовке честно пишет «по их же замерам», но 200x и 400x всё равно вынес в крючок.
- Точности в посте нет совсем. Слайды молчат, насколько Jev вообще угадывает. Вторичные источники называют около 68% совпадения с эталоном на бенчмарке компании, первоисточник этой цифры я не нашёл.
- Слайд 2 упрощён. Ответ вида
"срочно": "да", "уверенность": 0.94нарисован для наглядности. НастоящийNoulвозвращает одно число вероятности (в примере Cloudflare 0.95), слово «да» получаете вы сами порогом. Пример со слайда 6 (биллинг 0.52, поддержка 0.46) тоже иллюстрация, живого прогона за ним нет. - «Не галлюцинирует». Автор сам поправляет это на слайде 7, и правильно: схема гарантирует, что ответ будет из списка, а не что он верный. Кстати, при неверном ярлыке «биллинг» у бага со входом возврат уйдёт не тому клиенту, никакая схема этого не поймает.
- Доступ. Блог пишет про ранний доступ и вейтлист, квикстарт про очередь не упоминает, регистрацию я не проходил. Модели девять дней от релиза,
jev-latestэто скользящий алиас, при тюнинге порогов закрепляйте версию (в доке примерjev-1.13.0), у npm-пакета версия 0.6.0. - Пределы. Свободного текста нет, вариантов в одном вопросе до 255. Лимит контекста в источниках расходится: 32 тысячи токенов у Cloudflare, 64 тысячи в стороннем гайде. Тот же гайд предупреждает, что модель читает вопрос буквально, плохо считает и путается в датах. Это слова стороннего автора, сам не проверял.
- Схема со слайда 8 (Jev выбирает модель, одобряет вызов, проверяет результат) это идея автора. Каждый лишний вызов Jev добавляет задержку и ещё одно вероятностное суждение, которое тоже может ошибиться, а текст пользователя внутри
stateможет влиять на решение. - Бесплатный аналог из комментариев. Комментатор не назвал какой, но открытые повторения существуют (Simple Jev, Von и другие), лицензия Apache-2.0. Их сравнения с Jev самопальные, я ничего не запускал. Идея про маршрутизацию субагентов Claude из соседнего комментария того же типа: разумная, руками не проверена.
- Данные. В
stateуходят ваши тексты на сторонний американский сервис. Если там персональные данные клиентов или записи, сначала прочитайте условия TypeSafe и решите, можно ли.