Alle Artikel

#1 in Europa im Podonos Audio Deepfake Detection Benchmark

Das Ergebnis

Podonos hat 23 Systeme zur Erkennung KI-generierter Stimmen geprüft. Fennura belegt Platz 3, mit 98,63 % Genauigkeit, 1,2 % Fehlalarmen und 1,5 % übersehenen Fälschungen.

Im Podonos-Benchmark ist Fennura damit die Nummer 1 in Europa für die Erkennung von Audio-Deepfakes.

Die acht Bestplatzierten der 23 getesteten Systeme. Genauigkeit im Audio Deepfake Detection Benchmark von Podonos, September 2026.
Die acht Bestplatzierten der 23 getesteten Systeme.
Genauigkeit im Audio Deepfake Detection Benchmark von Podonos, September 2026.

Podonos schreibt dazu, die Spitze liege eng beieinander: Die ersten drei Systeme trennt weniger als ein Prozentpunkt, und alle drei halten beide Fehlerraten unter 1,6 %.

Erkennung ohne Cloud

Eine Bemerkung im Bericht ist uns wichtiger als die Platzierung. Podonos hält fest, dass Fennura als reiner CPU-Detektor eingereicht wurde, der auf dem Gerät arbeitet und zur Auswertung keine Grafikkarte benötigt.

Für Unternehmen ist das oft der entscheidende Punkt. Wer Mandanten-, Gesundheits- oder Vertragsdaten am Telefon bespricht, darf diese Gespräche häufig nicht extern weitergeben. Ein Erkennungssystem, das Audio in die Cloud schickt, scheitert dann nicht an der Technik, sondern an Datenschutz, Betriebsvereinbarung oder Verschwiegenheitspflicht.

Bei Fennura bleibt das Gespräch dort, wo es stattfindet. Keine Daten verlassen das Gerät. Zusätzlich senkt das die Anforderungen an die Hardware: Ein normaler Arbeitsplatzrechner genügt.

Warum dieser Test aussagekräftig ist

Anbieter von Erkennungssoftware veröffentlichen oft eigene Zahlen. Das Problem daran ist offensichtlich: Wer den Test selbst zusammenstellt, bestimmt auch das Ergebnis.

Der Podonos-Benchmark funktioniert anders. Die richtigen Antworten bleiben beim Betreiber. Kein Anbieter weiß vorher, welche Datei echt ist und welche nicht, niemand kann sein System auf den Test hin optimieren. Geprüft wurden 4.524 Dateien, je zur Hälfte echt und synthetisch, in sechs Dateiformaten. Die synthetischen Aufnahmen stammen von rund 25 kommerziellen Stimmklon-Tools, also von möglichen Tools, die Angreifer heute tatsächlich einsetzen könnten.

Fennura hat jede einzelne dieser Dateitypen ausgewertet. Manche Systeme im Feld haben einen Teil der Dateien zurückgewiesen und wurden dadurch nur auf einer kleineren Auswahl bewertet.

Zwei Fehlerarten, nicht eine

Bei Erkennungssoftware wird meist nur die Trefferquote genannt. Sie allein sagt wenig aus: Ein System, das jeden Anruf als Fälschung meldet, erkennt alle Deepfakes und ist trotzdem unbrauchbar.

Entscheidend sind beide Richtungen. Fehlalarme kosten Zeit und Vertrauen, übersehene Fälschungen kosten Geld. Mit 1,2 % zu 1,5 % liegen beide Werte bei Fennura nah beieinander.

Was der Benchmark offenlässt

Ein Testergebnis ist eine Momentaufnahme. Geprüft wurden fertige Dateien, nicht der Live-Betrieb mit Störgeräuschen und wechselnden Sprechern, und geprüft wurde gegen die Stimmklon-Modelle von heute. Unsere Auswertung dauert im Schnitt 553 Millisekunden und ist damit langsamer als die einiger Systeme im Feld. Dennoch resultiert daraus ein RTF (Real Time Faktor) von 0,14 und somit die Echtzeitfähigkeit auf einem handelsüblichen Office Laptop.

Wir halten diese Punkte für erwähnenswert. Ein Sicherheitsversprechen ist nur so viel wert wie die Offenheit über seine Grenzen.


Alle Benchmark-Ergebnisse sind öffentlich einsehbar: https://github.com/podonos/audio-dfd-benchmark

Stand der Benchmark-Daten: September 2026. Quelle: Podonos, Audio Deepfake Detection Benchmark.