OpenAIは2026年10月9日までに、ChatGPTで音声ファイルをアップロードできるようにしたと発表しました。有料ユーザーが対象です。アップロードした音声の文字起こしや要約に加え、内容について質問できます。
対応するのは、会議や講義、インタビューなどの録音をChatGPTに渡して扱う使い方です。ただし、どの有料プランが対象か、利用できる地域や提供開始の詳細は記事に記載されていません。
対応形式と容量
対応形式はWAV、MP3/MPEG、OGG/OGA、PCM、FLAC、AAC、M4Aのほか、音声のみのWebMとMP4です。ファイル容量の上限は512MBです。
長時間の録音は、処理が分割されたり、処理がタイムアウトしたりする場合があります。大きな録音を一度に処理できるとは限らないため、利用時には注意が必要です。
文字起こしは確認を
OpenAIは、文字起こしに内容や話者の識別の誤りが含まれる場合があるとしています。また、音声の理解や文字起こしの精度は、言語によって異なる可能性があります。重要な記録に使う場合は、結果を元の音声と照らし合わせる必要があります。
なぜ重要か
会議や講義の録音を扱う有料ユーザーは、音声をアップロードして要約や内容確認に使えます。一方、言語ごとの精度や対象プランの詳細は記事では示されておらず、重要な文字起こしは確認が必要です。