LinkedIn-Beiträge
Die Systeme, die ich baue, und die Forschung dahinter
Jeder Beitrag greift eine Entscheidung heraus, aus einem System, das ich gebaut habe, oder aus einem Beweis, den ich geführt habe: was schiefging, was ich geändert habe und welche Zahl danach stand.
-
47 auf 38: So tief fiel eine graphgestützte KI ohne ihre Fakten
Eine begutachtete Studie entfernte absichtlich Fakten aus einem Wissensgraphen. Mit 4 von 10 benötigten Fakten weniger erreichte das graphgestützte System genau den Wert des Modells ganz ohne Graph.
-
Die teurere KI-Suche verlor bei einfachen Faktenfragen
Eine begutachtete Studie auf der KDD 2026 schickte klassische Suche und Graphsuche durch dieselben Tests. Wer gewann, hing von der Frage ab, und der KI-Richter, der das Duell bewertete, drehte sein Urteil mitunter, sobald die Antworten die Plätze tauschten.
-
3× so genau bei Geschäftsfragen, mit demselben Modell
Forschende stellten GPT-4 43 Geschäftsfragen auf einem branchenüblichen Versicherungsdatenmodell. Was die Genauigkeit von 16,7 % auf 54,2 % hob, war nicht das Modell. Es war das, was das Modell zu lesen bekam.
-
Das Sicherheitsnetz beantwortete 32 von 150 Fragen aus dem falschen Dokument
Fand die Suche im richtigen Dokument nichts, durchsuchte mein System alles, damit Nutzer immer eine Antwort bekamen. Dieser Rückfallpfad machte aus einem sichtbaren Fehlschlag eine selbstbewusst falsche Antwort.
-
Der Agent führte die Prüfungen aus und schrieb den Bericht, dass sie bestanden sind
Wächter sagen, ob eine Aktion erlaubt war. Sie sagen nicht, ob der Agent getan hat, was er behauptet. Ein Hook am Sitzungsende führt sieben der acht Gates erneut aus, und die Zusammenfassung des Agenten ist nicht länger das Protokoll.
-
Ich habe drei Coding-Agenten mit Absicht weniger Fähigkeiten gegeben
Claude Code liefert einen Allzweck-Agenten, der in einer Codebasis fast alles kann. Daneben betreibe ich drei Spezialisten mit 46 ausdrücklichen Verboten, weil die Fähigkeit dort aufhört, die Grenze zu sein, wo Fehler Geld kosten.
-
Fünf Qualitätsgates bestanden, benotet vom Agenten, der den Code schrieb
Der Agent schrieb den Code, schrieb seine Tests, führte die Prüfungen aus und meldete fünfmal Grün. Nichts in der Pipeline war dafür gebaut zu fragen, wer den Prüfer prüft.
-
Habe ich eine Garantie, oder rate ich?
Die Konvergenzanalyse hat mir beigebracht, jedem Algorithmus eine Frage zu stellen. Diese Frage hat ein agentisches System für die Lieferkette geprägt, das entscheiden soll, wann es seinen eigenen Antworten nicht traut.
-
Ein handgetunter Prompt kam auf 91 %. Ein kompilierter auf 99 %.
Leiten Sie eine Frage zur Lieferkette falsch weiter, und eine Bestandsanfrage kommt mit einer Antwort zur Tourenplanung zurück. Ich habe den handgeschriebenen Klassifikator-Prompt durch einen mit DSPy kompilierten ersetzt und danach mehr Zeit in die Messung gesteckt als in das Kompilieren.
-
Gleiche Frage, andere Zahlen, falsche Antwort
„400 Einheiten zuteilen“ und „1 000 Einheiten zuteilen“ ergeben fast identische Vektoren. Ein Cache, der allein auf Ähnlichkeit setzt, serviert einer Leitung die Zahlen einer anderen.
-
Warum wir die Konvergenz am einfachsten Netz bewiesen haben, das es gibt
Die lineare Schicht ist der eine Baustein, den alle neuronalen Netze teilen. Ihre Verlustfunktion bleibt nichtkonvex, und ihr Training bleibt NP-vollständig. Deshalb ist sie der richtige Ort, um nach einer Garantie zu suchen.
-
Ich habe promoviert: Konvergenzanalyse des Trainings tiefer linearer neuronaler Netze
Die Lernrate hängt an Konstanten, die die bestehende Theorie vor dem Training nicht berechnen kann, also wählt man sie durch Probieren. Einen Teil dieser Lücke habe ich geschlossen, und dieselbe Strenge wende ich jetzt auf KI im Betrieb an.
-
Der Copilot antwortet weiter, wenn das Sprachmodell ausfällt
Eine Gratisstufe mit 50 API-Aufrufen am Tag hat jede Entwurfsentscheidung in diesem System bestimmt. Die Grenze ist weg. Die Architektur, die daraus entstand, blieb, weil sie sich ihren Platz verdient hat.
-
Der zuverlässigste Teil des Copilots ist der, den das Sprachmodell nie berührt
Lassen Sie ein Sprachmodell eine Logistikentscheidung planen, und Sie bekommen die statistisch wahrscheinlichste Antwort, nicht die günstigste. Also habe ich das Modell aus der Rechnung herausgehalten und die Arbeit in die Grenze dazwischen gesteckt.
-
Bei 10.000 $ hält der Agent an und ein Mensch entscheidet
Jeder Freigabeprozess braucht einen Betrag. Darunter führt der Agent aus, darüber unterschreibt eine Person. Der Fehler, der mir gezeigt hat, wo diese Prüfung hingehört, kam erst im Integrationstest heraus.