「Whisper」は、ChatGPTで有名なOpenAIが公開しているオープンソースの音声認識モデルだ。高精度な音声認識モデルで、英語だけでなく日本語を含めた多言語の音声をテキストに変換できる。ノイズの多い環境でも高い認識精度を誇り、議事録作成や字幕生成 ...
杉田 (@ane45) です。2024年12月の 「Python Monthly Topics」 は、OpenAIの音声認識モデルWhisperをPythonから使用する方法を解説します。さらに、Whisperモデルを基にした派生ツールやライブラリであるwhisper. cpp、faster-whisper、mlx-whisperについても紹介します。 Whisperとは ...
本ツールは、VOICEVOXで生成した音声ファイルを、スライド資料用にスライド単位にグループ化した音声ファイルに変換します。 使い方 プロジェクトをチェックアウトしたディレクトリに移動後に、以下を実行します。 poetry run python3 vv_wav2slide_wav.py INPUT_VV_WAVS ...