Praxistest · Stand: 30. August 2026
Deepgram: deutsche KI-Stimmen für ein Kinderspiel
Im Lernspiel meines Sohnes spricht jede Figur mit eigener Stimme: der Erzähler, die sprechende Uhr, Luca selbst. Keine davon habe ich eingesprochen — sie kommen von Deepgram, einem Sprach-API-Anbieter, dessen deutsche „Aura-2"-Stimmen erstaunlich warm und natürlich klingen. Neukunden bekommen 200 US-Dollar Startguthaben (Stand 08/2026) — bei unserer Bauweise reicht das praktisch endlos.
Wie wir es einsetzen
Jede Rolle hat ihr Stimmprofil. Vier
Sprechrollen, vier Aura-2-Stimmen — männlich, weiblich, jung, alt.
Diese deutschen Stimmen haben sich bei uns bewährt (Stand 08/2026):
aura-2-julius-de, aura-2-fabian-de
(männlich) sowie aura-2-elara-de,
aura-2-aurelia-de, aura-2-lara-de,
aura-2-kara-de und aura-2-viktoria-de
(weiblich).
Eine Anbieter-Kette statt eines Single Point of Failure. Deepgram steht vorn; antwortet es nicht, springt ElevenLabs ein, und wenn alle Stricke reißen, liest die Browser-Stimme vor. Das Spiel bleibt also nie stumm — es klingt höchstens mal eine Stufe weniger schön. Ehrliche Randnotiz aus dem Vergleich: ElevenLabs klingt eine Spur lebendiger, spricht Deutsch im Gratistarif aber mit hörbarem Akzent — deshalb hat Deepgram bei den Spielfiguren den Vortritt.
Ein Cache macht es bezahlbar. Jede gesprochene Zeile wird genau einmal erzeugt und dann als Audiodatei gespeichert — beim nächsten Abruf kommt sie aus dem Cache, ohne API-Aufruf. Der Nachtlauf, der neue Spielwelten schreibt, wärmt den Stimm-Cache gleich mit vor. Lehrgeld gab es trotzdem: Unser Stundenlimit stand anfangs auf 60 Zeilen — in den KI-Welten ist aber fast jeder Satz neu, und mitten im Spiel sprang plötzlich die Systemstimme ein. Seitdem: Limit hoch, Cache vorgewärmt, Ruhe.
Der iOS-Kniff. Safari auf dem iPhone mag unsere MP3-Häppchen nicht — es bekommt deshalb WAV. Praktisch: Von unseren beiden Stimm-Anbietern liefert nur Deepgram auf Wunsch WAV direkt aus der API.
Der Code dahinter
Der Kern ist ein einziger HTTP-POST: Text hin, fertige Audiodatei zurück. Mehr braucht eine Vorlesefunktion nicht:
$url = 'https://api.deepgram.com/v1/speak'
. '?model=aura-2-fabian-de&encoding=mp3';
$ch = curl_init($url);
curl_setopt_array($ch, [
CURLOPT_RETURNTRANSFER => true,
CURLOPT_POST => true,
CURLOPT_HTTPHEADER => [
'Authorization: Token ' . getenv('DEEPGRAM_API_KEY'),
'Content-Type: application/json',
],
CURLOPT_POSTFIELDS => json_encode(
['text' => 'Willkommen zurück, Abenteurer!'],
JSON_UNESCAPED_UNICODE
),
]);
file_put_contents('ansage.mp3', curl_exec($ch));
curl_close($ch);
Für iOS-taugliches WAV ändert sich nur die Adresse:
encoding=linear16&sample_rate=24000&container=wav.
Was man braucht — und was es kostet
Ein Konto, einen API-Schlüssel, ein paar Zeilen wie oben. Das Startguthaben von 200 US-Dollar wird pro Nutzung aufgebraucht, nicht pro Monat — für ein Hobby-Projekt mit Cache ist das eine sehr lange Zündschnur. Wichtig wie bei jedem API-Dienst: den Schlüssel serverseitig halten (Umgebungsvariable), nie in den Browser-Code legen, und ein eigenes Limit einbauen, bevor es der Anbieter für einen tut.
Was man damit noch anstellen könnte
Deepgrams eigentliches Kerngeschäft ist die Gegenrichtung: Sprache zu Text. Mit demselben Konto lassen sich Sprachnotizen und Interviews transkribieren, Videos automatisch untertiteln oder Sprachbefehle in eigene Anwendungen bauen. Und in unserer Richtung: eine Vorlesefunktion für die eigene Website, Hörversionen von Artikeln, selbst gebaute Gute-Nacht-Hörspiele mit verteilten Rollen — die Zutaten sind dieselben wie oben, nur der Text ändert sich.
Fazit
Für deutschsprachige Stimmen zum Basteln ist Deepgram aktuell mein Preis-Leistungs-Favorit: natürliche Aura-2-Stimmen, WAV für Apple-Geräte, großzügiges Startguthaben — und mit Cache plus Anbieter-Kette wird daraus ein Baustein, auf den man sich im Alltag verlassen kann. Empfohlen ohne Provision; verlinkt ist der Anbieter direkt.