AI Sources
IAVídeo··8 min de lectura

Jev, l'IA qui ne parle pas : 1 700 emails triés pour 18 centimes

Un modèle qui ne génère aucun texte, répond en 200 ms et ne sait faire qu'une chose : décider. Démonstration et cas d'usage.

Fuente : Greg Isenberg (avec Ryan Vogel) · YouTubeVer el original

En breve

Greg Isenberg reçoit Ryan Vogel, de l'équipe fondatrice d'OpenCode, pour décortiquer Jev, un modèle de classification attribué à Diogo Almeida (ex-chercheur derrière les travaux ayant mené à ChatGPT). Contrairement à un LLM, Jev ne produit pas de texte : on lui donne une entrée et un schéma de sortie, il renvoie des probabilités. Résultat annoncé en démo : 1 700 emails catégorisés, priorisés et scorés pour 18 centimes, avec environ 200 ms de latence par requête.

🍺 Versión de barra

Depuis trois ans, on a pris l'habitude de demander poliment à une IA de réfléchir à voix haute pendant trente secondes avant de nous dire si un email est du spam. Jev, lui, ne réfléchit pas, ne cause pas, ne te souhaite pas une bonne journée : tu lui envoies un truc, il te renvoie « spam : 0,9 » et il retourne se coucher. 1 700 emails traités pour 18 centimes, soit à peu près le prix d'un chewing-gum coupé en quatre. Ça compte parce que 80 % de ce qu'on fait faire aux LLM aujourd'hui, ce ne sont pas des dissertations, ce sont des décisions à deux balles payées au prix fort.

Para recordar

  1. 1

    Jev est présenté comme un classifieur : on lui passe une entrée (un email, un formulaire, une transcription) et un schéma de sortie, il renvoie des probabilités, jamais du texte libre.

  2. 2

    Démo centrale : 1 700 emails catégorisés (type, priorité, score de spam, probabilité de réponse méritée) pour 4,2 M de tokens en entrée, 500 k en sortie, et un coût total de 18 centimes.

  3. 3

    Latence annoncée d'environ 200 ms par requête, quelle que soit la structure d'entrée-sortie — à comparer aux dizaines de secondes et au streaming des modèles de raisonnement.

  4. 4

    Pas de chaîne de raisonnement visible, pas de texte intermédiaire : la sortie est typée et directement exploitable en code, ce qui séduit les développeurs.

  5. 5

    Les limites sont assumées dans la vidéo : un test de signal d'achat Bitcoin donne de mauvais résultats, et Ryan Vogel déconseille explicitement ce type d'usage.

  6. 6

    Cas d'usage évoqués : qualification de leads entrants, triage de tickets support, matching instantané de prestataires locaux, détection des meilleurs extraits d'une vidéo, pilotage de navigateur (vol Zurich-Londres trouvé en 7,1 secondes).

  7. 7

    Jev était en invite only au moment de l'enregistrement, mais accessible immédiatement via le gateway IA de Vercel.

Capítulos

0:00

Pourquoi cet épisode

Greg Isenberg annonce l'arrivée de Jev, attribué à Diogo Almeida, et invite Ryan Vogel pour expliquer de quoi il s'agit.

0:53

Une nouvelle catégorie d'IA

Ryan Vogel pose le cadre : après les LLM lents et bavards, un modèle de classification qui change la donne sur la qualité, la vitesse et le prix.

2:16

Le problème de l'email

Vogel introduit sa démo : trier une vraie boîte mail, là où les filtres classiques et les LLM sont soit imprécis, soit trop lents.

3:12

Qu'est-ce qu'un classifieur

L'exemple de l'iPhone et de sa couleur : une entrée, un schéma de sortie, et des probabilités qui totalisent 100 %.

4:31

Le schéma appliqué aux emails

Quatre sorties : catégorie, priorité sur cinq niveaux, score de spam en pourcentage, probabilité qu'une réponse soit justifiée.

6:26

1 700 emails, 18 centimes

Le traitement se termine presque instantanément : 4,2 M de tokens en entrée, 500 k en sortie, 18 centimes au total.

7:20

Le bon modèle mental

Isenberg reformule : Jev est un décideur. Vogel corrige : c'est un producteur de probabilités de décision, pas de décisions fermes.

9:06

Jev ne génère pas de texte

Au tableau blanc, Vogel montre qu'on ne pose pas de question à Jev : on lui envoie une entrée et un schéma, point.

11:48

Pourquoi les développeurs aiment ça

La sortie est typée et directement utilisable en code, sans post-traitement ni parsing hasardeux.

13:02

Aucun raisonnement

Pas de pensée à voix haute, pas de chaîne de raisonnement visible. C'est ce qui inquiète certains et ce qui rend le modèle rapide.

14:16

L'expérience des lettres

Vogel détourne Jev en lui faisant prédire lettre par lettre : ça marche, mal, mais ça illustre que ce n'est pas un modèle conversationnel.

15:46

Qualification des leads entrants

Premier cas d'usage concret : scorer les demandes reçues via un formulaire de contact pour une agence de design.

18:36

Triage de tickets et latence

Routage automatique des demandes support vers la bonne équipe, avec environ 200 ms par requête.

19:42

L'agent de circulation

Isenberg propose l'image du traffic cop : l'information entre, Jev décide qui la traite, humain ou machine.

20:48

Idées de startups

Repérer les métiers avec une file d'entrants coûteuse et y placer Jev : agrégation de services locaux, devis réellement instantanés.

22:51

L'échec du signal Bitcoin

Le test buy / hold / sell donne de mauvais résultats. Vogel déconseille clairement ce type d'usage.

24:01

Découpage automatique de vidéo

Transcription au mot près puis scoring des moments : 17 extraits pertinents identifiés en environ 3 secondes.

25:38

Pilotage de navigateur

Une démo de Browser Use : réservation d'un vol Zurich-Londres en 7,1 secondes, en temps réel.

26:23

Comment y accéder

Jev est sur liste d'attente, mais disponible immédiatement via le gateway IA de Vercel.

27:37

Conclusion

Vogel invite à tester pour quelques centimes et insiste sur le choc de vitesse.

Un modèle qui ne génère rien

Le point de bascule de l'épisode tient en une phrase de Ryan Vogel : on ne « demande » rien à Jev, parce que Jev n'est pas un modèle de texte. On lui envoie une entrée brute et un schéma de sortie, exactement comme on appellerait une API classique, et il renvoie un objet structuré.

L'exemple pédagogique est volontairement bête : un iPhone en entrée, une question « quelle couleur ? » avec cinq options en sortie. Jev ne répond pas « c'est orange », il répond 80 % orange, 10 % rouge, 10 % bleu. La somme fait 100, et c'est au code appelant de trancher.

Deuxième type de sortie : le nombre borné entre 0 et 1, utilisé pour les scores continus. « is_spam : 0,9 » vaut mieux qu'un booléen, parce que le spam est une question de degré, pas de vérité binaire.

Conséquence pratique soulignée dans la vidéo : la sortie est type-safe. Pas de JSON à réparer, pas de post-traitement, pas de « le modèle a répondu en prose alors que je voulais un entier ».

La démo email, et le chiffre qui fait mal

Ryan Vogel lance la classification de sa vraie boîte mail : 1 700 emails, chaque ligne étant l'objet email complet (expéditeur, sujet, corps), sans mise en forme particulière. Quatre sorties : catégorie, priorité sur cinq niveaux, score de spam, probabilité que l'email mérite une réponse.

Il commence à jouer le désespoir — dix heures de traitement, une facture salée — et le job se termine pendant sa phrase. 4,2 millions de tokens en entrée, 500 000 en sortie, 18 centimes au total.

L'exemple le plus parlant n'est pas le spam mais le score de réponse : un message d'utilisateur signalant un compte compromis ressort à 90 % de nécessité de réponse. Le modèle ne rédige rien, il désigne juste ce qui doit remonter à un humain.

Isenberg résume avec une image qui tient la route : Jev est un agent de circulation. L'information arrive, il décide où elle va et à quelle vitesse — humain, automatisation, LLM rédacteur, ou poubelle.

Les cas d'usage : partout où il y a une file d'attente

La règle proposée est simple : cherchez dans une activité l'endroit où quelqu'un doit regarder des données et prendre une décision rapide, et mettez Jev à cet endroit. Pas à 100 % des interactions, insiste Vogel : plutôt un rôle d'assistance appuyé.

Exemple vécu : la compagne de Ryan Vogel dirige une agence de design graphique et reçoit beaucoup de demandes par formulaire. Jev score chaque entrée sur un axe « bon lead » de 0 à 1. À 98 %, on répond tout de suite ; à 40 %, le prospect ne sait pas encore ce qu'il veut.

Autre piste, plus ambitieuse : l'agrégation de services locaux. Un utilisateur tape « nettoyer mon allée », Jev compare la demande au catalogue de prestataires du coin et renvoie des scores de compatibilité. Le fameux « devis instantané » qui, aujourd'hui, arrive par email en fin de journée.

Deux démos techniques concluent : un découpage automatique de vidéo en 17 moments intéressants scorés en environ 3 secondes, et un pilotage de navigateur par l'équipe Browser Use qui réserve un Zurich-Londres en 7,1 secondes, là où un agent classique mettrait plusieurs minutes.

Ce que Jev ne sait pas faire

La vidéo ne vend pas que du rêve. Le test de signal Bitcoin — acheter, garder, vendre, une évaluation par minute — donne de mauvais résultats, et Vogel le dit franchement : ne mettez pas ce modèle devant votre portefeuille.

La raison est structurelle. Jev n'a pas de raisonnement visible, ne va pas chercher d'information externe, ne recoupe pas de contexte. Sur ce même test, un modèle frontière classique fait mieux parce qu'il croise l'actualité. La comparaison n'est pas apples to apples, elle est apples to oranges.

À noter pour le lecteur attentif : la conversation cite au passage des noms de modèles OpenAI qui n'existent pas publiquement (« GPT 5.6 Luna », « GPT6 Astra »). Registre d'humour ou fiction assumée, mieux vaut les traiter comme du décor plutôt que comme des faits.

Côté accès, Jev était sur liste d'attente au moment de l'enregistrement. Le contournement donné : le gateway IA de Vercel, qui l'expose déjà et l'a intégré à son package AI.

You don't really ask Jev, because Jev isn't a text model.
4.2 million input tokens and 500,000 output tokens. The entire cost was 18 cents.
I would not put this model in front of your stock portfolio.

Por qué importa

L'industrie a passé trois ans à empiler du raisonnement, des tokens de réflexion et des agents qui monologuent — et à facturer tout ça. Or une part énorme du travail réel confié aux LLM en production n'est pas de la génération, c'est du tri : est-ce du spam, est-ce urgent, vers quelle équipe, ce lead vaut-il un rappel. Faire tourner un modèle frontière pour répondre « oui » est un gâchis structurel, et c'est exactement le créneau que vise Jev : une sortie typée, une latence de l'ordre de 200 ms, un coût quasi nul. Le risque est symétrique et il est réel : un modèle qui ne montre pas son raisonnement est un modèle qu'on audite mal, et l'épisode le prouve lui-même avec l'échec du signal Bitcoin. Il faut aussi noter que cette vidéo est un contenu d'évangélisation, pas une évaluation : aucun benchmark, aucune mesure de précision, des noms de modèles OpenAI manifestement fantaisistes, et une conclusion qui ressemble à un appel à l'inscription. L'idée de fond — séparer les modèles de décision des modèles de génération — mérite mieux que la démo, mais la démo suffit à comprendre pourquoi elle circule.

#ia#llm#classification#api#startup#vercel
Fuente original
Jev is HERE. How to use it
Greg Isenberg (avec Ryan Vogel)
Abrir el vídeo