
Deepslate erhält 7,7 Mio. Euro – Sprach-KI umgeht den Text

Das Berliner Start-up Deepslate hat eine Seed-Runde über 7,7 Millionen Euro abgeschlossen, wie Tech.eu am 1. Oktober 2026 berichtete; 42CAP führte die Finanzierung, Alstin Capital, Bestandsinvestor SIVentures und mehrere Business Angels beteiligten sich. Das Unternehmen will mit dem Geld eigene Sprachmodelle, europäische Trainingsdaten, Vertrieb und Infrastruktur ausbauen.
Der technische Kern ist ein Modell, das gesprochene Eingaben verarbeitet und gesprochene Antworten erzeugt, ohne eine fertige Abschrift an ein getrenntes Textmodell zu übergeben. Deepslate zielt damit auf Geschäftskunden, die automatisierte Gespräche führen lassen und Kontrolle über den Betrieb ihrer Sprachdaten benötigen. Mit der Finanzierung baut das Start-up die zugrunde liegende Modelltechnik selbst aus.
Wofür Deepslate das Kapital einsetzt
Ein Teil der Runde fließt in das Training für europäische Sprachen. Im Mittelpunkt stehen deutsche Straßen- und Personennamen sowie Dialekte, die für eine Sprachschnittstelle in einem Versicherungs- oder Contact-Center-Gespräch keine Nebensache sind. Ein falsch verstandener Name oder eine vertauschte Hausnummer kann den weiteren Dialog auf eine falsche Grundlage stellen, selbst wenn die Antwort flüssig klingt.
Daneben sollen Vertrieb und Vermarktung wachsen. Deepslate plant zusätzliche Produktionskapazität in europäischen Rechenzentren, um steigende Gesprächsvolumina zu bedienen. Die Ausgaben greifen ineinander: Ein besser angepasstes Modell hilft nur, wenn es unter der Last laufender Anrufe schnell genug antwortet; umgekehrt ersetzt zusätzliche Rechenkapazität keine verlässliche Verarbeitung regionaler Sprache. Konkrete Verbesserungswerte für diese Vorhaben sind bisher nicht veröffentlicht.
Der Audiopfad statt der Textkette
Der Unterschied zum verbreiteten Aufbau lässt sich als Ablauf zeigen: Übliche Kette: Spracheingabe → Spracherkennung → Text für ein Sprachmodell → Sprachsynthese → Audioausgabe. Deepslates Ansatz: Spracheingabe → zusammenhängendes Sprachmodell → Audioausgabe. In der zweiten Variante wird keine vollständige Abschrift als eigenständiger Zwischenschritt an einen anderen Dienst gereicht. Für den Hörer bleibt das Ergebnis eine gesprochene Antwort; geändert wird vor allem der Weg dorthin.
Das bedeutet nicht, dass im Modellinneren keine Verarbeitungsschritte existieren. Deepslate verbindet einen Encoder für das eingehende Audio, einen Verarbeitungskern auf Basis eines anpassbaren Sprachmodells und einen Decoder für die gesprochene Ausgabe. Die Bausteine sind über trainierbare Projektoren gekoppelt. Nach der beschriebenen Architektur kann der Kern ausgetauscht werden, ohne das gesamte System von Grund auf neu zu trainieren; wie viel Zeit und Rechenleistung ein solcher Wechsel tatsächlich spart, ist eine Aussage aus dem Unternehmensumfeld.
Der mögliche Vorteil des direkten Pfads liegt in Informationen, die eine Wortabschrift nur schlecht abbildet: Betonung, Pausen und Tonfall können die Bedeutung einer Äußerung verändern. Bleiben solche Signale für die weitere Verarbeitung verfügbar, muss das System sie nicht aus bloßen Wörtern rekonstruieren. Das ist allerdings kein Schutz vor Missverständnissen. Statt eines Fehlers in einer separaten Transkription kann ein Modell die akustische Eingabe selbst falsch deuten oder trotz richtiger Deutung eine ungeeignete Antwort erzeugen. Für den Gesprächspartner zählt am Ende die zutreffende Reaktion, nicht die Zahl der technischen Übergaben.
Was Latenz und Minutenpreis aussagen
In seiner Finanzierungsmitteilung nennt Deepslate 440 Millisekunden Antwortlatenz in einem externen Vergleich, einen API-Preis ab 2 Cent pro Gesprächsminute und produktive Einsätze bei Versicherern, Contact Centern und Plattformen. Der Geschwindigkeitswert beschreibt die Zeit bis zur ersten Audioausgabe im verglichenen Modellfeld. Er ist damit ein konkreter Vergleichswert, aber keine Messung der Dauer oder Qualität eines gesamten Kundengesprächs.
Im Gespräch können zusätzliche Zeiten für Telefonverbindung, Netzweg, Schnittstellen und nachgelagerte Systeme anfallen. Auch eine Unterbrechung durch den Anrufer oder eine Rückfrage zu einer unklaren Adresse verändert den Ablauf, ohne dass sich dies aus der Zeit bis zum ersten Ton ablesen ließe. Ähnlich ist der Einstiegspreis eine Tarifangabe für die Nutzung des Modells: Telefonie, Integration, zugesicherte Kapazität und ein Betrieb auf eigener Infrastruktur können die Gesamtkosten verändern. Ein pauschaler Kostenvorteil gegenüber anderen Anbietern lässt sich aus dem genannten Minutenpreis nicht berechnen.
Deutsche Cloud und Kundeninfrastruktur
Der Bericht von Trending Topics nennt ein 15-köpfiges Team, Hosting in der Telekom Cloud in Deutschland oder auf Kundeninfrastruktur und eine ISO-27001-Zertifizierung; Mitgründer Paskal Paesler sagt darin: „Datensouveränität ist für unsere Kunden kein Nice-to-have, sondern Voraussetzung“. Für Organisationen mit personenbezogenen Gesprächsdaten macht die Wahl des Betriebsorts einen konkreten Unterschied: Sie bestimmt, in welcher Umgebung die Verarbeitung stattfindet und wer den technischen Zugriff organisieren muss.
Ein Standort in Deutschland oder ein eigenes Rechenzentrum klärt allerdings noch nicht alle Datenflüsse. Entscheidend sind auch die Speicherung von Gesprächsinhalten, mögliche Protokolle, beteiligte Dienstleister und die vertraglich zugesagten Löschfristen. Ebenso brauchen Versicherer und Contact Center Nachweise dafür, wie das Modell mit Namen, Adressen und Unterbrechungen in ihren tatsächlichen Abläufen umgeht. Die geplante Erweiterung der europäischen Infrastruktur soll mehr Anrufe tragen; ob der direkte Audiopfad dabei zugleich zuverlässig und wirtschaftlich arbeitet, wird sich erst an offengelegten Ergebnissen aus solchen Einsätzen beurteilen lassen.
Lesen Sie auch:
Ähnliche Artikel


GPT‑Live‑1 hört beim Sprechen weiter zu – die Stimme kostet extra

Gemini 3.8 Live führt Tools aus – das Gespräch läuft im Hintergrund weiter

Klara nimmt Arbeitsagentur-Anrufe an – entscheiden dürfen weiter Menschen

Headline schließt 400-Mio.-Dollar-Fonds – Seed und Series A im Fokus

Gemini-Modell wählen: Live, Transcribe und Flash lösen andere Aufgaben
Newsletter abonnieren
Erhalten Sie die neuesten Nachrichten zu Web3, KI und Krypto direkt in Ihren Posteingang.