コンテンツにスキップ

音声入力モデル

設定 → 音声入力モデル でエンジンを切り替えます。速度・精度・オフライン可否・対応言語で選べます。初回起動時の既定は Apple のオンデバイス音声です。

UI プレビュー:設定ウィンドウの音声入力モデルページ
図 1 · 設定 → 音声入力モデル(UI 再現 · setup-03-models.webp

LicenseManager.isASRProviderAllowed

Free Trial / Pro
Apple(オンデバイス) カタログの全エンジン
Doubao(BYOK クラウド) Bailian、MiMo、Azure、Gemini、OpenAI Speech、Groq、ElevenLabs、Soniox、NVIDIA Speech NIM、OpenAI 互換 / 自前ゲートウェイなど
オンデバイス SenseVoice-Small(sherpa-onnx · 中/粤/英/日/韓)
オンデバイス Whisper Large-v3 Turbo(sherpa-onnx · 100+ 言語)
オンデバイス Fun-ASR-Nano(sherpa-onnx · 中英日 + 方言)
オンデバイス Parakeet TDT 0.6B v3(sherpa-onnx · 英語 + 25 欧州言語)

Base URL を localhost に向けても、OpenAI 互換 / faster-whisper などは引き続き multi-ASR 扱いのため Free では使えず、Trial または Pro が必要です。内蔵オンデバイス 4 エンジン(SenseVoice / Whisper Turbo / Fun-ASR-Nano / Parakeet)はこの制限外です。

種類 ネットワーク プラン
システム on-device Apple Speech / SpeechAnalyzer ローカル(システムが言語パックをダウンロードする場合あり) Free ✓。クラウドキー不要
内蔵 on-device(sherpa-onnx) SenseVoice、Whisper Turbo、Fun-ASR-Nano、Parakeet TDT 初回 DL 後オフライン Free ✓。API キー不要
リージョン向けクラウド Doubao、Bailian、MiMo あり Free は Doubao のみ。Bailian / MiMo は Trial/Pro
一般クラウド OpenAI Speech、Azure(MAI-Transcribe 2)、Gemini、Groq、ElevenLabs、Soniox あり BYOK。Trial/Pro
互換 / セルフホスト OpenAI 互換、faster-whisper、ローカルゲートウェイ デプロイによる localhost 可だが Trial/Pro 必須
NVIDIA クラウド Speech NIM(クラウド Parakeet など) あり / セルフホスト Trial/Pro(内蔵 Parakeet とは別)

フルリストは App 内カタログが基準です。オンデバイスモデルは 一括認識(キーを離した後に推論。話しながら出るストリーミング方式ではありません)。初回使用時にランタイム / 重みを数百 MB〜約 1.5 GB ダウンロードします。

  • キーは macOS キーチェーン に保存されます(サービス名は Bundle ID に紐づきます)。
  • VoiceHotkey はアカウント必須のクラウドを運営 しません。音声は選んだサードパーティにだけ送られます(オンデバイスエンジンは音声をアップロードしません)。
  • 詳細は BYOK とデータの流れ を参照。

ファイル転写 では、ライブ音声入力とは 独立 したモデル設定を使えます(設定 → ファイル転写 → モデルを選択)。エンジンのプラン要件はライブ音声入力と同じです(Free:Apple / Doubao / 内蔵 4 オンデバイスエンジン)。ファイル転写 を参照。

ローカルのみモード がオンのとき、非ループバックの公衆エンドポイントは失敗します。Apple内蔵 4 オンデバイスエンジン は常に許可されます。その他のエンジンは Base URL / WS を localhost / 127.0.0.1 / ::1 に向け、かつ 上のプラン要件も満たす必要があります。

一部のエンジンはコンテキスト / プロンプト / 辞書フィールドに対応しています(Soniox terms、Whisper prompt など)。エンジンごとの設定に人名・ブランド・用語を入力してください。書き起こし後のフォールバックとして 単語置換 も使えます。