thewhisper

リアルタイム処理とオンデバイス動作に最適化したWhisper音声認識モデル。Apple SiliconやNVIDIA GPUに対応し、文字起こしや翻訳に使えます。

Xで共有ライセンス: MIT

概要

TheWhisper は、ストリーミングやオンデバイス利用向けに最適化した Whisper の音声認識モデルを提供します。元の 30 秒ではなく可変のチャンクサイズに対応した公開ウェイトを Hugging Face で配布し、NVIDIA GPU 向けの推論エンジンと、Apple Silicon の macOS 向け CoreML エンジンも用意しています。セルフホストとローカル文字起こしを重視し、サンプルのフロントエンド付きローカル REST API も含みます。

主な特長

  • 可変チャンクサイズのストリーミング文字起こし
  • Whisper モデルの公開ウェイトを Hugging Face で提供
  • NVIDIA GPU 向け推論エンジン
  • macOS と Apple Silicon 向け CoreML エンジン
  • JavaScript と Electron の例付きローカル REST API

こんな人・用途に

NVIDIA や Apple のハードウェアで、高速なセルフホストまたはオンデバイスの文字起こしを使いたい開発者向けです。ローカルのノートアプリ作りなどに向きます。

アップストリーム
TheStageAI/TheWhisper
GitHubのフォーク
Guo-astro/thewhisper
アップストリームのスター数
897
カテゴリ
ドキュメント・メディア・コンテンツ
言語
Python
ライセンス
MIT
フォーク日
2025-11-21
同期状態
同期済み最終同期 2026-09-29