Kategorie: Lip Reading


  • MouthMind – Lippenlesen ohne Pixel

    Ich habe ein Forschungsprojekt abgeschlossen: MouthMind – ein Seq2Seq-Modell für visuelle Spracherkennung, das komplett ohne Pixel auskommt. Statt Bildern verwendet es Gesichts-Marker – reine Geometrie. Keine Hautfarbe, kein Licht, keine Kleidung. Nur Bewegung. Das Modell wurde ohne Teacher Forcing trainiert. Es muss Buchstaben selbstständig generieren – und zeigt dabei emergente Generalisierung: Es erkennt Wörter, die es nie gesehen hat. Die Ergebnisse sind…

  • Lip Reading auf 2,44 Millionen Frames: Von optimalen Ergebnissen zu überraschendem Modellkollaps

    Eine Fallstudie zum Training großer KI-Modelle Ausgangspunkt: Das Ziel Das Projekt verfolgte ein klar definiertes Ziel: die Entwicklung eines robusten Lip-Reading-Modells (automatisches Lippenlesen) auf Basis eines massiven Datensatzes mit über 2,44 Millionen Einzelbildern (Frames). Der Fokus lag nicht nur auf der finalen Performance, sondern auch auf der Analyse des Trainingsverlaufs und der dabei auftretenden Dynamiken.…