MP3、M4A(iPhoneのボイスメモが使う形式)、WAV、WebM、OGGを直接アップロード可能。MP4やMOVなどの動画ファイルも対応 — Scholarlyは音声トラックをテキスト化し、映像は無視します。数時間の講義など長い録音も問題なく、事前に分割する必要はありません。
音声をテキストに変換すると逐語記録が得られます — すべての文が順番通りに、タイムスタンプと話者ターン付きで。エッセイの引用、定義の正確な言い回し、セミナーで誰が何を言ったかなど、正確な文言が重要なときに役立ちます。録音を凝縮してトピック別に整理したい場合は、 音声からノート を使ってください — 内部で同じ書き起こしを行った上で、構造化された学習ノートに要約します。どちらの場合も全文の書き起こしは添付されたまま残るので、元のテキストを失うことはありません。
クリアな音声では精度は高く — きれいな講義やインタビューの録音はほぼ一語一句に近い形で返ってきます。書き起こしにはタイムスタンプが付いているので、ある単語が怪しいときは全体を読み直すのではなく、その秒に直接ジャンプして数タップで音声と照合できます。
精度を本当に下げるのはモデルではなく録音です:話者から遠いマイク、激しい同時発話、背景ノイズの上に重なる強い訛り、専門用語の多さは、いずれもテキストを劣化させます。引用する数値・名前・専門用語など重要な用途では、そのタイムスタンプで音声と照合してください。数秒で済み、実際に話された内容に対して検証できます。
録音はScholarlyワークスペースの「ソース」になるため、再アップロードなしで書き起こしの上にすべてを積み上げられます:全文をどんな用語でも検索、クリーンな学習ノートに変換、間隔反復フラッシュカードや練習クイズを生成、あるいはAIチャットに質問して音声の該当箇所を引用した回答を取得。テキストが音声より便利なのは、まさに活用できるからです — そして学習しながら書き起こしを読むことは、録音を受動的に聞き返すよりはるかに理解を深めます。
まず逐語のテキストが必要ですか? 講義文字起こしツール はまさにそのために作られています — 話者ターンをそのまま残した、検索可能でタイムスタンプ付きの授業全体の書き起こしです。