Zum Inhalt springen

Spracheingabemodelle

Engines wechseln Sie unter Einstellungen → Spracheingabemodelle. Auswahl nach Geschwindigkeit, Genauigkeit, Offline-Fähigkeit und Sprachunterstützung. Beim ersten Start ist meist Apple On-Device-Sprache voreingestellt.

UI-Vorschau: Spracheingabemodelle-Bereich des Einstellungsfensters
Abb. 1 · Einstellungen → Spracheingabemodelle (UI-Nachbau · setup-03-models.webp)

LicenseManager.isASRProviderAllowed:

Free Testversion / Pro
Apple (on-device) Alle Katalog-Engines
Doubao (BYOK-Cloud) Inklusive Bailian, MiMo, Azure, Gemini, OpenAI Speech, Groq, ElevenLabs, Soniox, NVIDIA Speech NIM, OpenAI-kompatible / selbst gehostete Gateways u. a.
On-Device SenseVoice-Small (sherpa-onnx · Chinesisch/Kantonesisch/Englisch/Japanisch/Koreanisch)
On-Device Whisper Large-v3 Turbo (sherpa-onnx · 100+ Sprachen)
On-Device Fun-ASR-Nano (sherpa-onnx · Chinesisch/Englisch/Japanisch + Dialekte)
On-Device Parakeet TDT 0.6B v3 (sherpa-onnx · Englisch + 25 europäische Sprachen)

Auch wenn die Base URL auf localhost zeigt, gelten OpenAI-kompatible / faster-whisper u. a. weiterhin als Multi-Engine und sind in Free nicht verfügbar — dafür ist die Testversion oder Pro nötig. Die vier integrierten On-Device-Engines (SenseVoice / Whisper Turbo / Fun-ASR-Nano / Parakeet) fallen nicht darunter.

Art Beispiele Netzwerk Plan
System on-device Apple Speech / SpeechAnalyzer Lokal (System lädt ggf. Sprachpakete) Free ✓; kein Cloud-Key nötig
Integriert on-device (sherpa-onnx) SenseVoice, Whisper Turbo, Fun-ASR-Nano, Parakeet TDT Offline nach Erst-Download der Gewichte Free ✓; ohne API-Key
Regionale Cloud Doubao, Bailian, Xiaomi MiMo Ja Free nur Doubao; Bailian / MiMo → Testversion/Pro
Allgemeine Cloud OpenAI Speech, Azure (MAI-Transcribe 2), Gemini, Groq, ElevenLabs, Soniox Ja BYOK; Testversion/Pro
Kompatibel / Self-Host OpenAI-kompatibel, faster-whisper, lokales Gateway Je nach Deployment localhost möglich; trotzdem Testversion/Pro
NVIDIA-Cloud Speech NIM (u. a. Cloud-Parakeet) Ja oder Self-Hosting Testversion/Pro (anders als On-Device-Parakeet)

Maßgeblich ist der Katalog in der App. On-Device-Modelle erkennen ganze Segmente am Stück (Inferenz nach dem Loslassen, kein Streaming-Wort-für-Wort); bei der ersten Nutzung werden einige Hundert MB bis ~1,5 GB Runtime/Gewichte heruntergeladen.

  • Schlüssel liegen im macOS-Schlüsselbund (Dienstname hängt von der Bundle-ID ab).
  • VoiceHotkey betreibt keine verpflichtende Account-Cloud; Audio geht nur an die von Ihnen gewählten Drittanbieter (On-Device-Engines laden nichts hoch).
  • Details: BYOK & Datenfluss.

Die Dateitranskription kann eine unabhängige Modellkonfiguration nutzen, getrennt von der Live-Spracheingabe (Einstellungen → Dateitranskription → Modell auswählen). Die Plan-Schwellen der Engines sind dieselben wie bei der Live-Spracheingabe (Free: Apple / Doubao / 4 integrierte On-Device-Engines). Siehe Dateitranskription.

Ist der Nur-lokal-Modus aktiv, schlagen nicht-loopback öffentliche Endpunkte fehl. Apple und die vier integrierten On-Device-Engines sind immer erlaubt; andere Engines brauchen eine Base URL / WS auf localhost / 127.0.0.1 / ::1 und müssen weiterhin die obigen Plan-Schwellen erfüllen.

Einige Engines unterstützen Kontext- / Prompt- / Wörterbucheinträge (etwa Soniox terms oder Whisper-Prompt). Tragen Sie dort Namen, Marken und Fachbegriffe der jeweiligen Engine ein. Zur Absicherung danach Wortersetzungen nutzen.