LinkedIn-Beiträge

Die Systeme, die ich baue, und die Forschung dahinter

Jeder Beitrag greift eine Entscheidung heraus, aus einem System, das ich gebaut habe, oder aus einem Beweis, den ich geführt habe: was schiefging, was ich geändert habe und welche Zahl danach stand.

  • Beitrag

    47 auf 38: So tief fiel eine graphgestützte KI ohne ihre Fakten

    Eine begutachtete Studie entfernte absichtlich Fakten aus einem Wissensgraphen. Mit 4 von 10 benötigten Fakten weniger erreichte das graphgestützte System genau den Wert des Modells ganz ohne Graph.

    • Wissensgraphen
    • GraphRAG
    • Evaluation
  • Beitrag

    Die teurere KI-Suche verlor bei einfachen Faktenfragen

    Eine begutachtete Studie auf der KDD 2026 schickte klassische Suche und Graphsuche durch dieselben Tests. Wer gewann, hing von der Frage ab, und der KI-Richter, der das Duell bewertete, drehte sein Urteil mitunter, sobald die Antworten die Plätze tauschten.

    • RAG
    • Wissensgraphen
    • Evaluation
  • Beitrag

    3× so genau bei Geschäftsfragen, mit demselben Modell

    Forschende stellten GPT-4 43 Geschäftsfragen auf einem branchenüblichen Versicherungsdatenmodell. Was die Genauigkeit von 16,7 % auf 54,2 % hob, war nicht das Modell. Es war das, was das Modell zu lesen bekam.

    • Wissensgraphen
    • KI im Unternehmen
    • Evaluation
  • Beitrag

    Das Sicherheitsnetz beantwortete 32 von 150 Fragen aus dem falschen Dokument

    Fand die Suche im richtigen Dokument nichts, durchsuchte mein System alles, damit Nutzer immer eine Antwort bekamen. Dieser Rückfallpfad machte aus einem sichtbaren Fehlschlag eine selbstbewusst falsche Antwort.

    • RAG
    • Retrieval
    • Evaluation
  • Beitrag

    Der Agent führte die Prüfungen aus und schrieb den Bericht, dass sie bestanden sind

    Wächter sagen, ob eine Aktion erlaubt war. Sie sagen nicht, ob der Agent getan hat, was er behauptet. Ein Hook am Sitzungsende führt sieben der acht Gates erneut aus, und die Zusammenfassung des Agenten ist nicht länger das Protokoll.

    • Agentic AI
    • KI-Governance
    • Softwaretests
  • Beitrag

    Ich habe drei Coding-Agenten mit Absicht weniger Fähigkeiten gegeben

    Claude Code liefert einen Allzweck-Agenten, der in einer Codebasis fast alles kann. Daneben betreibe ich drei Spezialisten mit 46 ausdrücklichen Verboten, weil die Fähigkeit dort aufhört, die Grenze zu sein, wo Fehler Geld kosten.

    • Agentic AI
    • Multi-Agenten-Systeme
    • KI-Governance
  • Beitrag

    Fünf Qualitätsgates bestanden, benotet vom Agenten, der den Code schrieb

    Der Agent schrieb den Code, schrieb seine Tests, führte die Prüfungen aus und meldete fünfmal Grün. Nichts in der Pipeline war dafür gebaut zu fragen, wer den Prüfer prüft.

    • Agentic AI
    • Softwaretests
    • Evaluation
  • Beitrag

    Habe ich eine Garantie, oder rate ich?

    Die Konvergenzanalyse hat mir beigebracht, jedem Algorithmus eine Frage zu stellen. Diese Frage hat ein agentisches System für die Lieferkette geprägt, das entscheiden soll, wann es seinen eigenen Antworten nicht traut.

    • Agentic AI
    • Konvergenzanalyse
    • KI-Sicherheit
  • Beitrag

    Ein handgetunter Prompt kam auf 91 %. Ein kompilierter auf 99 %.

    Leiten Sie eine Frage zur Lieferkette falsch weiter, und eine Bestandsanfrage kommt mit einer Antwort zur Tourenplanung zurück. Ich habe den handgeschriebenen Klassifikator-Prompt durch einen mit DSPy kompilierten ersetzt und danach mehr Zeit in die Messung gesteckt als in das Kompilieren.

    • DSPy
    • Evaluation
    • Agentic AI
  • Beitrag

    Gleiche Frage, andere Zahlen, falsche Antwort

    „400 Einheiten zuteilen“ und „1 000 Einheiten zuteilen“ ergeben fast identische Vektoren. Ein Cache, der allein auf Ähnlichkeit setzt, serviert einer Leitung die Zahlen einer anderen.

    • Agentic AI
    • Semantischer Cache
    • ML in Produktion
  • Beitrag

    Warum wir die Konvergenz am einfachsten Netz bewiesen haben, das es gibt

    Die lineare Schicht ist der eine Baustein, den alle neuronalen Netze teilen. Ihre Verlustfunktion bleibt nichtkonvex, und ihr Training bleibt NP-vollständig. Deshalb ist sie der richtige Ort, um nach einer Garantie zu suchen.

    • Deep Learning
    • Optimierung
    • Konvergenzanalyse
  • Beitrag

    Ich habe promoviert: Konvergenzanalyse des Trainings tiefer linearer neuronaler Netze

    Die Lernrate hängt an Konstanten, die die bestehende Theorie vor dem Training nicht berechnen kann, also wählt man sie durch Probieren. Einen Teil dieser Lücke habe ich geschlossen, und dieselbe Strenge wende ich jetzt auf KI im Betrieb an.

    • Deep Learning
    • Optimierungstheorie
    • Konvergenzanalyse
  • Beitrag

    Der Copilot antwortet weiter, wenn das Sprachmodell ausfällt

    Eine Gratisstufe mit 50 API-Aufrufen am Tag hat jede Entwurfsentscheidung in diesem System bestimmt. Die Grenze ist weg. Die Architektur, die daraus entstand, blieb, weil sie sich ihren Platz verdient hat.

    • Agentic AI
    • Systementwurf
    • ML in Produktion
  • Beitrag

    Der zuverlässigste Teil des Copilots ist der, den das Sprachmodell nie berührt

    Lassen Sie ein Sprachmodell eine Logistikentscheidung planen, und Sie bekommen die statistisch wahrscheinlichste Antwort, nicht die günstigste. Also habe ich das Modell aus der Rechnung herausgehalten und die Arbeit in die Grenze dazwischen gesteckt.

    • Agentic AI
    • Operations Research
    • Neuro-symbolische KI
  • Beitrag

    Bei 10.000 $ hält der Agent an und ein Mensch entscheidet

    Jeder Freigabeprozess braucht einen Betrag. Darunter führt der Agent aus, darüber unterschreibt eine Person. Der Fehler, der mir gezeigt hat, wo diese Prüfung hingehört, kam erst im Integrationstest heraus.

    • Agentic AI
    • Mensch in der Schleife
    • KI im Unternehmen