Automatisierte Spracherkennung – Audiotranskription
Durch automatisierte Transkription können Sprachinhalte aus gängigen Audio- und Videodateien in Textform extrahiert und anschließend weiterverarbeitet und genutzt werden. Das Forschungsdatenzentrum unterstützt Sie mit einer Toolberatung zu kostenfreien KI-Transkriptionstools, die u. a. lokal auf dem eigenen PC genutzt werden können.
Open Source Transkriptionstools
noScribe und aTrain sind kostenfreie, Open-Source-Apps für Windows, Linux und Mac zur automatischen Audiotranskription. Beide Tools basieren auf dem kostenfreien KI-Modell whisper, unterstützen bis zu 99 Sprachen und ermöglichen die Annotation von Sprechenden (bspw. in Interviewsituationen oder Gruppendiskussionen). Da sie lokal auf dem eigenen PC laufen, können sie DSGVO-konform genutzt werden (es findet kein Datenaustausch mit Cloud-Providern statt). Darüber hinaus bieten beiden Tools verschiedene Exportformate an (.txt, .html, etc.).
Transkription größerer Datenmengen
Mit dem Tool whisply, das ebenfalls auf whisper basiert, können Sie auch große Datenmengen in kurzer Zeit lokal bearbeiten und transkribieren. Anleitungen zur Installation und Nutzung finden Sie auf der GitHub-Seite von whisply.
Mit maKI bietet die Universität Mannheim zudem einen OpenAI-kompatiblen API-Dienst an, der vollständig auf der universitätseigenen Infrastruktur betrieben wird. Transkriptionen von Audio- und Videodateien können hier mit den Parakeet-Modellen von NVIDIA erstellt werden. Es verlassen weder Anfragen noch Daten die Universität.
Services
Das FDZ unterstützt Sie unter anderem in folgenden Bereichen:
- Allgemeine Beratung zur Audiotranskription multimedialer Inhalte
- Beratungen zur Nutzung von noScribe und aTrain
- Beratung zu DSGVO-Aspekten im Hinblick auf Audiotranskriptionen
- Unterstützung bei der Weiterverarbeitung der Transkription (z. B. Umwandlung von unstrukturierten in strukturierte Daten)
Kontakt

Forschungsdatenzentrum (FDZ)
Universitätsbibliothek Mannheim
Schloss Schneckenhof West
68161 Mannheim
