Lokale Transkriptions- und Sprecher-Diarisation-Pipeline mit MLX Whisper und Pyannote.
- Lokale Verarbeitung: Alle Daten bleiben auf deinem Rechner
- Beste Qualität: Whisper Large v3 Turbo + Pyannote Community 3.1
- Apple Silicon Optimiert: MLX Whisper nutzt die GPU für schnelle Transkription
- Sprecher-Erkennung: Automatische Zuordnung von Textsegmenten zu Sprechern
- Interaktive UI: Sprecher können umbenannt und bearbeitet werden
- SQLite Speicherung: Alle Transkriptionen werden lokal gespeichert
- Erstelle ein Konto bei Hugging Face
- Erstelle ein Access Token
- Akzeptiere die Nutzungsbedingungen für:
# Virtuelle Umgebung erstellen
python -m venv .venv
source .venv/bin/activate
# Abhängigkeiten installieren
pip install -r requirements.txt# .env Datei erstellen
cp .env.example .env
# Token eintragen
nano .env # HF_TOKEN=dein_token_hierpython -m backend.api.mainDer API läuft dann auf http://localhost:8000.
| Endpoint | Methode | Beschreibung |
|---|---|---|
/health |
GET | Health Check |
/api/transcribe |
POST | Audio-Datei hochladen und Transkription starten |
/api/tasks/{task_id} |
GET | Status eines Transkriptions-Tasks abfragen |
/api/transcriptions |
GET | Alle Transkriptionen auflisten |
/api/transcriptions/{id} |
GET | Einzelne Transkription abrufen |
/api/transcriptions/{id}/speakers/rename |
PUT | Sprecher umbenennen |
/api/transcriptions/{id}/export |
POST | Transkription exportieren (txt, srt, json, csv) |
/api/transcriptions/{id}/audio |
GET | Audio-Datei abrufen |
/api/transcriptions/{id} |
DELETE | Transkription löschen |
diatrans/
├── backend/
│ ├── api/ # FastAPI Endpoints
│ ├── core/ # Konfiguration & Database
│ ├── models/ # SQLAlchemy & Pydantic Models
│ └── services/ # Business Logic (Transcription, Diarization, Alignment)
├── frontend/ # React UI (in Entwicklung)
├── data/ # SQLite Database
├── downloads/ # Hochgeladene Audio-Dateien
└── requirements.txt # Python Dependencies
MIT