Ich habe ein Forschungsprojekt abgeschlossen: MouthMind – ein Seq2Seq-Modell für visuelle Spracherkennung, das komplett ohne Pixel auskommt.

Statt Bildern verwendet es Gesichts-Marker – reine Geometrie. Keine Hautfarbe, kein Licht, keine Kleidung. Nur Bewegung.

Das Modell wurde ohne Teacher Forcing trainiert. Es muss Buchstaben selbstständig generieren – und zeigt dabei emergente Generalisierung: Es erkennt Wörter, die es nie gesehen hat.

Die Ergebnisse sind dokumentiert. Der Code ist nicht öffentlich – aus gutem Grund.

Mehr dazu: github.com/wobushannes/mouthmind


Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert