en
Alle Referenzen

[ transkription × vertrieb ]

Mitschreiben ohne Mitschnitt.

Das eigentliche Geschäft im Vertrieb passiert im Gespräch: im Kundentermin, im Meeting, am Telefon. Die Dokumentation danach kostet Abende, und Aufnehmen wäre bequem, ist aber ein Datenschutz-Risiko. Diese Projektreferenz löste beides: Gespräche werden live im Browser transkribiert, das Audio wird nie gespeichert, und ein KI-Agent macht aus dem Transkript Besuchsbericht, Aufgaben und CRM-Einträge. Im täglichen Einsatz ist das System im Vertriebsalltag eines Head of Sales. Diese Seite zeigt, wie es aufgebaut ist, welche Entscheidungen dahinterstehen und welche Erfahrungen auf dem Weg entstanden sind.

Keine Aufnahme

Das Audio wird live transkribiert und die Audiospur sofort verworfen. Gespeichert wird nur Text, nicht der Ton.

Sprecher getrennt

Das Transkript kennt die Sprecher: Anonyme Marker werden per Klick zu Namen, das Gespräch bleibt als Dialog lesbar.

Vom Gespräch zur Aufgabe

Ein Klick schickt das Transkript an einen KI-Agenten. Minuten später stehen Besuchsbericht, Aufgaben und CRM-Eintrag bereit.

Einwilligung eingebaut

Vor jeder Aufnahme steht die Pflicht-Einwilligung, mit Zeitstempel gespeichert. Und Löschen ist endgültig, kein Papierkorb.

[ vertrieb ohne schreibarbeit ]

Die beste Notiz ist die, die niemand schreiben muss.

Wer verkauft, verbringt den Tag in Gesprächen und den Abend mit deren Dokumentation: Besuchsberichte schreiben, Aufgaben notieren, das CRM pflegen. Vieles davon bleibt liegen, und mit jedem Tag Abstand gehen Details verloren, auf die es im nächsten Gespräch angekommen wäre.

Aufzeichnen wäre der bequeme Ausweg, aber ein Mitschnitt ist ein Datenschutz-Risiko und verändert Gespräche. Der bessere Weg: mitschreiben statt mitschneiden. Die Transkription läuft live, das Audio wird im selben Moment verworfen, verarbeitet wird datenschutzkonform, und vor jeder Aufnahme steht die Einwilligung. Es bleibt nur, was eine Notiz auch enthalten hätte: Text.

Das Ergebnis: Der Vertrieb führt Gespräche statt Protokolle. Minuten nach dem Termin stehen Bericht, Aufgaben und CRM-Eintrag, nichts geht verloren, und das nächste Gespräch beginnt mit vollem Kontext.

[ architektur ]

Drei Schritte, keine Schreibarbeit. Vom Gespräch zum Ergebnis

Für den Nutzer sind es drei Schritte: Einwilligung einholen, Transkript an den Agenten übergeben, Nachbereitung freigeben. Dahinter hält der Audio-Pfad den Ton komplett aus dem eigenen Backend heraus, die Transkript-Schicht speichert nur Text und lässt den Nutzer entscheiden, und die Agenten-Schicht macht daraus Arbeitsergebnisse.

Audio-Pfad

Vom Mikrofon direkt zum Text

Kein Audio wird gespeichert: Der Ton wird live transkribiert und im selben Moment verworfen, das eigene Backend berührt er nie. Es bleibt ausschließlich Text.

Transkribiert wird live: vorläufiger Text sofort, finale Abschnitte etwa alle zwei Sekunden, Sprechertrennung in Echtzeit, sechs Sprachen zur Wahl. Ein Bot, der sich ins Meeting einwählt, ist dafür nicht nötig: Die Mitschrift läuft unauffällig im Browser, ob Präsenztermin, Videocall oder Telefonat.

Bewusst nicht genutzt wird die eingebaute Diktierfunktion des Browsers: Sie verarbeitet die Sprache im EU-Ausland und wäre damit nicht DSGVO-konform. Stattdessen läuft die Transkription über einen Dienst mit datenschutzkonformer Verarbeitung.

Transkript & Übergabe

Nur Text wird gespeichert, der Nutzer behält die Hand

Das Transkript liegt als bearbeitbares Markdown mit Sprecher-Markup vor, strikt je Nutzer isoliert und mit Tests abgesichert. Gelöscht wird hart und endgültig, ganz bewusst ohne Papierkorb.

Die Übergabe an den Agenten ist Push statt Pull: Der Nutzer schickt das Transkript aktiv, der Agent holt sich nichts von selbst. Und er bekommt das volle Original, keine Vor-Zusammenfassung. Eine Stunde Gespräch sind grob 12.000 bis 15.000 Tokens, etwa sieben Prozent des Kontextfensters, eine Anzeige warnt bei langen Gesprächen.

Nachvollziehbarkeit ohne Rohdaten: Die Einwilligung wird mit Zeitstempel gespeichert, Zugriffe werden protokolliert, mit gehashter IP statt Klartext.

Agent & CRM

Vom Transkript zu Bericht, Aufgaben und CRM-Eintrag

Der Agent ist über eine Systemanweisung definiert: Sie bestimmt, wie der Besuchsbericht aussieht, welche Aufgaben mit Verantwortlichen und Folgeterminen abgeleitet werden und ob gleich ein Entwurf der Follow-up-Mail entsteht. Der Fachbereich passt das selbst an, ohne Code.

Das CRM ist per OAuth angebunden, serverseitig begrenzt auf die freigegebenen Werkzeuge. Im Einsatz ist HubSpot, der Weg funktioniert für jedes angebundene System gleich.

Schreibende Aktionen, eine Notiz anlegen, eine Aufgabe erstellen, werden als Veränderung erkannt und landen im Freigabe-Postfach. Erst die Bestätigung führt aus: Der Mensch bleibt die letzte Instanz vor dem Kundendatensatz.

[ erfahrungen ]

Die Tücken stecken im Browser.

Die lehrreichsten Fehler waren unsichtbar: Die Echo-Unterdrückung des Browsers filterte den eigenen Sprecher aus dem Signal, beim Transkriptionsdienst kam Stille an. Und Browser ignorieren gelegentlich die angeforderte Abtastrate, dann wird aus Sprache Rauschen. Wer Audio live verarbeitet, muss dem Browser jedes Detail nachprüfen, statt sich auf die Voreinstellungen zu verlassen.

Die naheliegende Abkürzung wäre die eingebaute Diktierfunktion des Browsers gewesen. Sie fiel durch: Die Verarbeitung läuft im EU-Ausland und ist damit nicht DSGVO-konform. Die Lehre daraus: Datenschutz funktioniert als Architektur, nicht als Fußnote. Und dazu gehört die ehrliche Grenze, dass kein Werkzeug die Information der Gesprächsteilnehmer ersetzt. Deshalb ist die Einwilligung Pflicht, vor jeder einzelnen Aufnahme, mit gespeichertem Zeitstempel.

[ zahlen ]

Das System in Zahlen

0

Audio-Dateien werden gespeichert: Der Ton wird live transkribiert und sofort verworfen

100 %

der Transkripte gehören dem Nutzer: Nur er sieht sie, nur er bearbeitet sie, und Löschen ist endgültig

6

Sprachen stehen aktuell bereit, erweiterbar je nach Anforderung, mit Sprechertrennung in Echtzeit

~2 Sekunden

hinter dem Gespräch läuft der finale Text: mitgeschrieben, während noch gesprochen wird

[ technologie ]

Eingesetzte Technologie

HubSpot
AG2 / AutoGen
Django
Next.js
React
HubSpot
AG2 / AutoGen
Django
Next.js
React
TypeScript
PostgreSQL
Redis
Docker
TypeScript
PostgreSQL
Redis
Docker

Nutzen Sie das Potenzial dieser Technologie.

Führen auch Sie viele Gespräche, stecken in vielen Meetings und möchten Technologie, die Sie in der Nachbereitung unterstützt? Dann lassen Sie uns sprechen: Sie bringen die Herausforderung mit, ich bringe die Erfahrung und die Werkzeuge.