Ir al contenido

Modelos de escritura por voz

Cambia de motor en Ajustes → Modelos de escritura por voz. Elige según velocidad, precisión, si funciona sin conexión y los idiomas que soporta. En el primer arranque suele venir voz local de Apple por defecto.

Vista previa de la IU: panel de modelos de escritura por voz en Ajustes
Fig. 1 · Ajustes → Modelos de escritura por voz (réplica de UI · setup-03-models.webp)

LicenseManager.isASRProviderAllowed:

Free Trial / Pro
Apple (en el dispositivo) Todos los motores del catálogo
Doubao (nube BYOK) Incluye Bailian, MiMo, Azure, Gemini, OpenAI Speech, Groq, ElevenLabs, Soniox, NVIDIA Speech NIM, compatibles con OpenAI / gateways propios, etc.
SenseVoice-Small local (sherpa-onnx · chino/cantonés/inglés/japonés/coreano)
Whisper Large-v3 Turbo local (sherpa-onnx · más de 100 idiomas)
Fun-ASR-Nano local (sherpa-onnx · chino/inglés/japonés + dialectos)
Parakeet TDT 0.6B v3 local (sherpa-onnx · inglés + 25 lenguas europeas)

Aunque la Base URL apunte a localhost, lo compatible con OpenAI / faster-whisper etc. sigue contando como multi-motor y no está disponible en Free; hace falta Trial o Pro. Los cuatro motores locales integrados (SenseVoice / Whisper Turbo / Fun-ASR-Nano / Parakeet) están fuera de esa regla.

Tipo Ejemplos Red Plan
Sistema en dispositivo Apple Speech / SpeechAnalyzer Local (el sistema puede descargar paquetes de idioma) Free ✓; sin clave en la nube
Integrados en el dispositivo (sherpa-onnx) SenseVoice, Whisper Turbo, Fun-ASR-Nano, Parakeet TDT Sin conexión tras descargar los pesos la primera vez Free ✓; sin API key
Nube regional Doubao, Bailian, Xiaomi MiMo Free solo Doubao; Bailian / MiMo → Trial/Pro
Nube general OpenAI Speech, Azure (MAI-Transcribe 2), Gemini, Groq, ElevenLabs, Soniox BYOK; Trial/Pro
Compatible / autoalojado Compatible OpenAI, faster-whisper, gateway local Según despliegue Puede usar localhost; aun así Trial/Pro
Nube NVIDIA Speech NIM (Parakeet en la nube, etc.) Sí o autoalojado Trial/Pro (distinto del Parakeet local)

Manda el catálogo dentro de la app. Los modelos locales reconocen el segmento completo (inferencia al soltar la tecla, no streaming palabra a palabra); el primer uso descarga de varios cientos de MB a ~1,5 GB de runtime/pesos.

  • Las claves se guardan en el Keychain de macOS (el nombre del servicio depende del Bundle ID).
  • VoiceHotkey no obliga a una cuenta en su nube; el audio solo va a los terceros que elijas (los motores locales no suben audio).
  • Más detalle en BYOK y flujo de datos.

La transcripción de archivos puede usar una configuración de modelo independiente de la escritura por voz en vivo (Ajustes → Transcripción de archivos → Elegir modelo). Los umbrales de plan de los motores son los mismos que en vivo (Free: Apple / Doubao / cuatro motores locales integrados). Ver Transcripción de archivos.

Con el modo Solo local activo, los puntos finales públicos que no sean de loopback fallan. Apple y los cuatro motores locales integrados siempre están permitidos; los demás motores necesitan Base URL / WS en localhost / 127.0.0.1 / ::1 y seguir cumpliendo los umbrales de plan de arriba.

Algunos motores admiten contexto / prompt / entradas de diccionario (p. ej. terms de Soniox o el prompt de Whisper). Rellena nombres, marcas y términos en los ajustes de cada motor. Después, usa sustituciones de palabras como red de seguridad.