Ich habe ein Forschungsprojekt abgeschlossen: MouthMind – ein Seq2Seq-Modell für visuelle Spracherkennung, das komplett ohne Pixel auskommt. Statt Bildern verwendet es Gesichts-Marker – reine Geometrie. Keine Hautfarbe, kein Licht, keine Kleidung. Nur Bewegung. Das Modell wurde ohne Teacher Forcing trainiert. Es muss Buchstaben selbstständig generieren – und zeigt dabei emergente Generalisierung: Es erkennt Wörter, die es nie gesehen hat. Die Ergebnisse sind…
Ein kleines Forschungs- und Experimentierprojekt, das größer wurde als gedacht Wie alles begann Es begann mit einer einfachen Frage: Wie bringt man KI-Neulingen bei, was eigentlich hinter den ganzen Schlagworten wie „Neuronales Netz“ oder „Machine Learning“ steckt? Die meisten Tutorials setzen entweder Programmierkenntnisse voraus, erfordern teure Cloud-Infrastruktur oder sind einfach zu abstrakt. Also habe ich mich…
Heute möchte ich euch ein Projekt vorstellen, an dem ich in den letzten Monaten intensiv gearbeitet habe: „aura_suite“ – mein selbst entwickeltes, autarkes Enterprise-Customer-Relationship-Management-Portal. 🔗 Projekt auf GitHub: https://github.com/wobushannes/aura_suite Die Idee hinter aura_suite Ich habe dieses System von Grund auf entwickelt, weil ich eine Zero-Cloud-CRM-Lösung vermisst habe – ein Portal, das: Die gesamte Datenhaltung erfolgt über strukturierte JSON-Dateien direkt im…
Oder: Warum ich lieber 200 Stunden programmiere, als 20 Euro im Monat für Buchhaltungssoftware zu zahlen Der Moment, in dem ich den Verstand verloren habe Es war ein Dienstag. Oder vielleicht ein Donnerstag. Die Tage verschwimmen, wenn man sich mit Steuerberater-Kommunikation, Belegsortierung und der Frage „Warum zur Hölle habe ich diesen Kassenzettel von 2023 noch?“…
Deepfakes werden täglich besser. Die Gesichter sind perfekt, die Mimik stimmt, die Stimme klingt echt. Wer nur hinsieht, wird getäuscht. Die jüngste Entwicklung ist alarmierend: Hochwertige Deepfake-Videos können mittlerweile einen realistischen Herzschlag imitieren – was bisher als sicheres Erkennungsmerkmal galt, fällt damit aus. Die Forscher am Fraunhofer Heinrich-Hertz-Institut (HHI) zeigten, dass moderne Deepfakes die physiologischen Signaturen der…
Die digitale Identität ist zu einem der wertvollsten Güter unserer Zeit geworden. Während Passwörter geknackt und Zwei-Faktor-Token abgefangen werden können, bietet die biometrische Authentifizierung eine Alternative, die schwerer zu kompromittieren ist. Doch herkömmliche biometrische Systeme speichern oft sensible Rohdaten – ein Risiko, das viele Anwender scheut. FaceHash ID verfolgt einen anderen Ansatz. Statt Fingerabdrücke oder…
Eine Fallstudie zum Training großer KI-Modelle Ausgangspunkt: Das Ziel Das Projekt verfolgte ein klar definiertes Ziel: die Entwicklung eines robusten Lip-Reading-Modells (automatisches Lippenlesen) auf Basis eines massiven Datensatzes mit über 2,44 Millionen Einzelbildern (Frames). Der Fokus lag nicht nur auf der finalen Performance, sondern auch auf der Analyse des Trainingsverlaufs und der dabei auftretenden Dynamiken.…
Einleitung: Die Genesis einer präzisionsgetriebenen Scan-Revolution In der dynamischen und stets sich transformierenden Sphäre der digitalen Bildverarbeitung etabliert sich das Projekt Bild/Papier-Scanner als ein bahnbrechendes Monument wissenschaftlicher Ingeniosität, das die Grenzen der Unstimmigkeitserkennung und -korrektur in gescannten Medien neu definiert. Dieses ambitionierte Vorhaben integriert hochentwickelte Machine-Learning-Paradigmen, insbesondere eine intricately gestaltete Autoencoder-Architektur, um die vielschichtigen, multidimensionalen…
Wer regelmäßig mit PDFs, Scans oder Datenbanken arbeitet, kennt das Problem: Man verbringt mehr Zeit mit Suchen als mit Auswerten. Herkömmliche OCR-Tools stoßen schnell an Grenzen, und Cloud-Lösungen sind oft keine Option – sei es aus Datenschutzgründen oder weil Internetverbindungen unzuverlässig sind. Genau hier setzt das PDF OCR & RAG Tool an. Es kombiniert klassische Texterkennung mit…
In der heutigen digitalen Welt wird die effiziente Verarbeitung von Dokumenten immer wichtiger. Ich habe eine Python-basierte Anwendung entwickelt, die OCR (Optical Character Recognition), Dokumentenverarbeitung und semantische Suche in einem benutzerfreundlichen Interface vereint. In diesem Artikel möchte ich die Funktionsweise und Besonderheiten dieser Lösung vorstellen. Die Kernfunktionen der Anwendung Die Anwendung bietet mehrere zentrale Funktionen:…










