Jev: Eine KI, die nicht reden will – und genau deshalb spannend ist

TypeSafe AI hat ein Modell gebaut, das keinen einzigen Satz schreiben kann. Klingt nach Rückschritt – könnte aber für viele Aufgaben das bessere Werkzeug sein als jedes LLM.

Ein erstaunlich großer Teil von dem, was heute mit LLMs gebaut wird, macht im Kern nur eins: das Modell fragen “Ist das hier A, B oder C?”, dann die Antwort parsen, dann hoffen, dass da wirklich nur A, B oder C drinsteht. Und nicht "Das ist eindeutig A! Hier ist meine Begründung: …". Klingt vertraut?

Letzte Woche hat TypeSafe AI ein Modell vorgestellt, das genau dieses Problem ernst nimmt. Es heißt Jev. Und es kann keinen einzigen Satz schreiben.

Endlich mal eine KI, die einfach die Klappe hält und antwortet.

Was ist Jev überhaupt?

Jev ist am 15. September 2026 in einer begrenzten Early-Access-Phase gestartet. Dahinter steckt TypeSafe AI aus San Francisco, gegründet 2024 – unter anderem von Diogo Almeida, der vorher bei OpenAI am InstructGPT-Paper und an RLHF mitgearbeitet hat. Also nicht irgendein Garagen-Startup, sondern Leute, die wissen, wie LLMs von innen aussehen.

TypeSafe nennt das Ganze ein System One Model. Der Name kommt aus Daniel Kahnemans “Schnelles Denken, langsames Denken”: System 1 ist das schnelle, intuitive Bauchurteil. System 2 das langsame, bewusste Nachdenken. LLMs mit ihren Reasoning-Ketten sind eher System 2. Jev will System 1 sein.

Der Unterschied zu “normalen” LLMs

Ein LLM erzeugt Text. Token für Token, eins nach dem anderen (autoregressiv). Auch wenn du JSON willst, bekommst du am Ende einen String, der hoffentlich valides JSON ist.

Jev macht das nicht. Du gibst ihm zwei Dinge:

  1. State – die unstrukturierten Daten, z. B. ein Support-Ticket, einen Logeintrag, eine Mail
  2. Typisierte Fragen – mit vorher festgelegten Antwortmöglichkeiten

Zurück kommen typisierte Werte: Bei Choice und Score gibt’s zusätzlich eine Wahrscheinlichkeitsverteilung über alle Optionen und einen Confidence-Score, Noul liefert direkt die Ja-Wahrscheinlichkeit. Kein Text, nichts zu parsen. Alle Fragen werden parallel beantwortet, nicht nacheinander.

Dafür gibt es genau drei Primitive:

  • Choice – eine Option aus einer Menge (bis zu 255 Optionen)
  • Score – Einordnung auf einer geordneten Skala (2 bis 10 Stufen)
  • Noul – Ja/Nein als Wahrscheinlichkeit zwischen 0 und 1

So sieht das in Python aus:

from typesafe_sdk import Choice, Noul, Score, TypeSafeClient

client = TypeSafeClient()

response = client.system_one(
    state={"ticket": "Mir wurde zweimal abgebucht. Bitte sofort korrigieren!"},
    questions={
        "department": Choice(
            instructions="Welches Team soll das bearbeiten?",
            criteria={"billing": "Zahlungsprobleme", "technical": "Bugs"},
        ),
        "frustration": Score(
            instructions="Wie frustriert ist der Kunde?",
            criteria=["Ruhig", "Genervt", "Sehr wütend"],
        ),
        "refund_requested": Noul(
            instructions="Der Kunde fordert ausdrücklich eine Erstattung",
        ),
    },
)

print(response.answers["department"].choice)   # "billing"
print(response.answers["frustration"].score)   # z. B. 1.7

Kein Prompt-Engineering à la “Antworte NUR mit einem Wort!!!”. Kein Regex hinterher. Das Schema ist der Vertrag.

Was mich daran wirklich reizt

Tempo und Preis. TypeSafe spricht von 70–500 ms pro Anfrage und davon, 40- bis 200-mal schneller und bis zu 400-mal günstiger zu sein als Frontier-LLMs. Input kostet 0,042 $ pro Million Token, Output ist kostenlos. Bei LLMs ist Output meist der teure Teil.

Keine kaputten Antworten. Jev kann strukturell nichts zurückgeben, was nicht im Schema steht. Kein "billing (probably)", kein halbes JSON, kein Roman.

Echte Wahrscheinlichkeiten. Das finde ich fast am spannendsten. Wenn ein LLM sagt “Ich bin mir zu 90 % sicher”, ist das auch nur generierter Text. Jev liefert eine Verteilung über alle Optionen – kalibriert per eigenem Trainingsverfahren (RLCD, Reinforcement Learning for Calibrated Decisions). Damit kann man im Code sauber sagen: Unter 0,8 Confidence geht’s an einen Menschen.

Der Haken: Es kann halt nur das

Sagen wir mal so: Jev ist ein Spezialwerkzeug. Und wie jedes Spezialwerkzeug ist es für alles andere unbrauchbar.

  • Kein Text, kein Code, keine Zusammenfassungen. Null.
  • Kein Reasoning, keine Planung. Es ist ein Bauchurteil, kein Nachdenken.
  • Nimmt dich wörtlich. Laut Doku beantwortet Jev die Frage, die du geschrieben hast, nicht die, die du gemeint hast. Schwammige Kriterien = schwammige Ergebnisse.
  • Zählen und Datumsrechnung sind laut Doku unzuverlässig. Welches Datum war früher? Lieber selbst ausrechnen.
  • Kontext: maximal 64k Token für State und alle Fragen zusammen – und die Genauigkeit sinkt, je mehr irrelevantes Zeug im State steht.
  • Bisher nur Text-State, keine Bilder.

Und dann das Marketing-Wort, das mir sauer aufstößt: “kann nicht halluzinieren”. Technisch stimmt das nur halb. Jev kann keine Antwort erfinden, die nicht im Schema steht. Aber es kann sehr wohl die falsche Option wählen – mit hoher Confidence. Das ist keine Halluzination im klassischen Sinn, aber für dein Ticket, das bei der falschen Abteilung landet, fühlt es sich genauso an.

Wo Jev das bessere Werkzeug ist

Überall dort, wo ein LLM eigentlich nur als teurer, langsamer Klassifikator missbraucht wird:

  • Routing: Tickets, Mails, Anfragen an die richtige Stelle schicken
  • Klassifikation & Scoring: Dringlichkeit, Sentiment, Priorität, Spam
  • Guardrails: LLM-Output prüfen – Enthält das personenbezogene Daten? Ist das off-topic?
  • Agenten-Entscheidungen: Der Agent fragt nicht jedes Mal das große Modell “Welches Tool jetzt?”, sondern eine schnelle, günstige Entscheidungsschicht
  • Echtzeit-Schleifen: Spiele, Robotik, Simulationen – überall, wo 5 Sekunden Denkpause keine Option sind
  • Masse: Millionen Datensätze vorsortieren, wo LLM-Kosten schlicht explodieren würden

Die Faustregel, die ich mir gebaut habe:

Wenn die Antwort in ein enum passt, brauchst du kein LLM.

Wo du weiter ein LLM willst

  • Text, Code, Übersetzungen, Zusammenfassungen – logisch
  • Alles, was mehrstufiges Nachdenken braucht
  • Offene Fragen, bei denen du die möglichen Antworten vorher nicht kennst
  • Gespräche mit Menschen

Die spannendste Architektur ist ohnehin die Kombination: Jev als schnelle Entscheidungsschicht davor oder dahinter, das LLM nur dann, wenn wirklich gedacht oder geschrieben werden muss. System 1 und System 2 – wie bei uns eben auch.

Was sonst noch erwähnenswert ist

Die Benchmarks sind hausgemacht. Die beeindruckenden Zahlen stammen aus TypeSafes eigenen Workflow-Evaluationen. Das Unternehmen räumt selbst ein, dass die eher das obere Ende darstellen. Unabhängige Tests gibt es bisher nur wenige und kleine.

So neu ist die Idee nicht. Zero-Shot-Klassifikation gibt es seit Jahren. Neu ist die Verpackung: ein Modell, das komplett auf dieses Problem trainiert ist, mit sauberer API und kalibrierten Wahrscheinlichkeiten. Das ist kein Nachteil – aber auch keine Revolution.

Black Box. Keine Weights, kein Paper, keine veröffentlichte Architektur. Manche vermuten, dass unter der Haube ein Open-Weight-LLM steckt. Wissen tut’s niemand.

Datenschutz. Proprietäres Modell, US-Cloud, kein Self-Hosting. Für mich als jemand, der gern alles selbst betreibt, ist das ein echter Minuspunkt. Wer Kundentickets durch Jev jagt, schickt Kundendaten in die USA – das sollte man vorher mit der DSGVO klären.

Zugang. Nach fünf Tagen Warteliste hat TypeSafe Jev am 20. September für alle geöffnet – und zwei Tage später neue Anmeldungen wegen des Ansturms vorübergehend pausiert. Bestehende Accounts laufen weiter. Ich hab es selbst nicht ausprobiert und hab das ehrlich gesagt auch gerade nicht vor – ich fand das Konzept einfach interessant. Alles hier basiert auf Doku und Berichten.

Fazit

Jev ist kein LLM-Killer. Es ist das Eingeständnis, dass wir LLMs seit Jahren für Aufgaben einsetzen, für die sie eigentlich überdimensioniert sind. Wie mit dem Vorschlaghammer einen Nagel in die Wand hauen – geht, aber es gibt Hämmer.

Wenn die Versprechen halbwegs halten, wird so ein Modell in vielen Pipelines das LLM an genau den Stellen ersetzen, wo es heute nur A, B oder C sagen soll. Schneller, billiger, berechenbarer. Ob die Qualität mithält, zeigt sich erst, wenn unabhängige Tests da sind. Bis dahin: neugierig, aber nicht euphorisch.

Bleibt neugierig, Alex