Schlagwort: Lippenlesen-KI


  • MouthMind – Lippenlesen ohne Pixel

    Ich habe ein Forschungsprojekt abgeschlossen: MouthMind – ein Seq2Seq-Modell für visuelle Spracherkennung, das komplett ohne Pixel auskommt. Statt Bildern verwendet es Gesichts-Marker – reine Geometrie. Keine Hautfarbe, kein Licht, keine Kleidung. Nur Bewegung. Das Modell wurde ohne Teacher Forcing trainiert. Es muss Buchstaben selbstständig generieren – und zeigt dabei emergente Generalisierung: Es erkennt Wörter, die es nie gesehen hat. Die Ergebnisse sind…