Spracheingabemodelle
Engines wechseln Sie unter Einstellungen → Spracheingabemodelle. Auswahl nach Geschwindigkeit, Genauigkeit, Offline-Fähigkeit und Sprachunterstützung. Beim ersten Start ist meist Apple On-Device-Sprache voreingestellt.
setup-03-models.webp)Welche Engines Free nutzen kann
Abschnitt betitelt „Welche Engines Free nutzen kann“LicenseManager.isASRProviderAllowed:
| Free | Testversion / Pro |
|---|---|
| Apple (on-device) | Alle Katalog-Engines |
| Doubao (BYOK-Cloud) | Inklusive Bailian, MiMo, Azure, Gemini, OpenAI Speech, Groq, ElevenLabs, Soniox, NVIDIA Speech NIM, OpenAI-kompatible / selbst gehostete Gateways u. a. |
| On-Device SenseVoice-Small (sherpa-onnx · Chinesisch/Kantonesisch/Englisch/Japanisch/Koreanisch) | |
| On-Device Whisper Large-v3 Turbo (sherpa-onnx · 100+ Sprachen) | |
| On-Device Fun-ASR-Nano (sherpa-onnx · Chinesisch/Englisch/Japanisch + Dialekte) | |
| On-Device Parakeet TDT 0.6B v3 (sherpa-onnx · Englisch + 25 europäische Sprachen) |
Auch wenn die Base URL auf localhost zeigt, gelten OpenAI-kompatible / faster-whisper u. a. weiterhin als Multi-Engine und sind in Free nicht verfügbar — dafür ist die Testversion oder Pro nötig. Die vier integrierten On-Device-Engines (SenseVoice / Whisper Turbo / Fun-ASR-Nano / Parakeet) fallen nicht darunter.
Häufige Engines
Abschnitt betitelt „Häufige Engines“| Art | Beispiele | Netzwerk | Plan |
|---|---|---|---|
| System on-device | Apple Speech / SpeechAnalyzer | Lokal (System lädt ggf. Sprachpakete) | Free ✓; kein Cloud-Key nötig |
| Integriert on-device (sherpa-onnx) | SenseVoice, Whisper Turbo, Fun-ASR-Nano, Parakeet TDT | Offline nach Erst-Download der Gewichte | Free ✓; ohne API-Key |
| Regionale Cloud | Doubao, Bailian, Xiaomi MiMo | Ja | Free nur Doubao; Bailian / MiMo → Testversion/Pro |
| Allgemeine Cloud | OpenAI Speech, Azure (MAI-Transcribe 2), Gemini, Groq, ElevenLabs, Soniox | Ja | BYOK; Testversion/Pro |
| Kompatibel / Self-Host | OpenAI-kompatibel, faster-whisper, lokales Gateway | Je nach Deployment | localhost möglich; trotzdem Testversion/Pro |
| NVIDIA-Cloud | Speech NIM (u. a. Cloud-Parakeet) | Ja oder Self-Hosting | Testversion/Pro (anders als On-Device-Parakeet) |
Maßgeblich ist der Katalog in der App. On-Device-Modelle erkennen ganze Segmente am Stück (Inferenz nach dem Loslassen, kein Streaming-Wort-für-Wort); bei der ersten Nutzung werden einige Hundert MB bis ~1,5 GB Runtime/Gewichte heruntergeladen.
API-Schlüssel
Abschnitt betitelt „API-Schlüssel“- Schlüssel liegen im macOS-Schlüsselbund (Dienstname hängt von der Bundle-ID ab).
- VoiceHotkey betreibt keine verpflichtende Account-Cloud; Audio geht nur an die von Ihnen gewählten Drittanbieter (On-Device-Engines laden nichts hoch).
- Details: BYOK & Datenfluss.
Dateitranskriptions-Modelle
Abschnitt betitelt „Dateitranskriptions-Modelle“Die Dateitranskription kann eine unabhängige Modellkonfiguration nutzen, getrennt von der Live-Spracheingabe (Einstellungen → Dateitranskription → Modell auswählen). Die Plan-Schwellen der Engines sind dieselben wie bei der Live-Spracheingabe (Free: Apple / Doubao / 4 integrierte On-Device-Engines). Siehe Dateitranskription.
Nur-lokal-Modus
Abschnitt betitelt „Nur-lokal-Modus“Ist der Nur-lokal-Modus aktiv, schlagen nicht-loopback öffentliche Endpunkte fehl. Apple und die vier integrierten On-Device-Engines sind immer erlaubt; andere Engines brauchen eine Base URL / WS auf localhost / 127.0.0.1 / ::1 und müssen weiterhin die obigen Plan-Schwellen erfüllen.
Eigennamen verbessern
Abschnitt betitelt „Eigennamen verbessern“Einige Engines unterstützen Kontext- / Prompt- / Wörterbucheinträge (etwa Soniox terms oder Whisper-Prompt). Tragen Sie dort Namen, Marken und Fachbegriffe der jeweiligen Engine ein. Zur Absicherung danach Wortersetzungen nutzen.
