Modulate positioniert sich bewusst auf der Gegenseite der Stimm-Synthese: Das Unternehmen nutzt KI nicht zur Erzeugung, sondern zur Auswertung von Sprache. Grundlage ist die firmeneigene ELM-Architektur, aus der die mehr als 100 Einzelmodelle der Plattform Velma hervorgehen. Sie sollen Emotion, Tonfall, Absicht, synthetische Sprache und Gesprächsverhalten auseinanderhalten können.
Zu den Leistungsdaten macht das Unternehmen eigene Angaben: Velma arbeite doppelt so genau wie herkömmliche große Sprachmodelle und erzeuge siebenmal weniger Fehlalarme. Die Modelle für Transkription und Deepfake-Erkennung hätten in öffentlichen Vergleichstests, etwa auf Hugging Face, jeweils den ersten Platz belegt. Das analysierte Volumen beziffert Modulate auf über zehn Millionen Stunden Audio pro Monat und mehr als 600 Millionen Stunden insgesamt.
Die Einsatzfelder reichen von der Absicherung von Gesundheitseinrichtungen gegen Angreifer, die mit Deepfake-Stimmen arbeiten, über die Verbesserung von Empathie und Emotionserkennung in Sprach-KI-Agenten bis zur Eindämmung von Extremismus und Belästigung auf Social-Media-Plattformen. Ebenfalls genannt werden die Überwachung der Leistungsfähigkeit von Sprachagenten, das Erkennen und Unterbrechen von Grooming-Gesprächen mit Kindern sowie der Schutz von Einsatzkräften in Hochrisikoszenarien, deren Identität durch fortgeschrittene Stimmverfremdung verborgen werden soll.
„Stimme wird zur zentralen Schnittstelle für KI, und daraus entsteht eine ganz neue Klasse von Problemen, die sich nicht anhand eines Transkripts lösen lassen", sagt Carter Huffman, Geschäftsführer und Mitgründer von Modulate. Man setze audio-native KI bereits ein, um Organisationen vor Deepfake-Angriffen zu schützen, Sprachagenten zum Erkennen von Emotionen und zu empathischeren Antworten zu befähigen, gefährliches Verhalten in Online-Gesprächen zu identifizieren und zu prüfen, ob Sprachagenten tatsächlich so funktionieren wie vorgesehen.
Das frische Kapital soll in Team und Infrastruktur fließen sowie in den Ausbau von Modellen, Programmierschnittstellen, SDKs, Integrationen und Bereitstellungsoptionen für Entwickler und Partner, die Sprachanwendungen bauen. Parallel will das Unternehmen weiter in eigene Forschung und Technologie investieren.
Huffman begründet diesen Fokus mit dem Aufwand, den Entwickler heute betreiben müssen: „Entwickler sollten die Audio-Intelligenzschicht nicht jedes Mal neu bauen müssen, wenn sie ein neues Spracherlebnis schaffen." Die Aufgabe des Unternehmens sei es, jene Modelle und Infrastruktur bereitzustellen, die es Entwicklern erlauben, sich auf ihre eigentliche Anwendung zu konzentrieren. Der Markt für audio-native KI wachse außerordentlich schnell; die Technologie sei gebaut und im großen Maßstab erprobt, das Investment erlaube nun schnelleres Wachstum.
Der Hintergrund: Sowohl der gezielte Betrug mit KI-gestützten Deepfakes als auch der einfache Missbrauch von Sprache zu herabwürdigenden Zwecken gehören inzwischen zum Alltag. Deepfakes zu erkennen und Missbrauch früh genug zu bemerken, um Schaden zu verhindern, ist ohne KI kaum möglich — und Anwendungen zu entwickeln, die Stimmmissbrauch zuverlässig aufspüren, ist technisch anspruchsvoll. Genau hier will Modulate ansetzen.
