Tools

YouTube動画を要約する方法:完全ガイド

平均的な人は1日におよそ50分間YouTubeを視聴しています。その大半は数時間のうちに記憶から消えてしまいます。要約とは、動画の消費を長く残る知識へと変えるスキルなのです。

13 分で読めます
重要なポイント
    • 要約は学習のスーパーパワー:FiorellaとMayerによる生成的学習のレビューでは、要約は受動的な復習を一貫して上回り、特に学習者が自分自身の言葉で要約を書いたときにその効果が顕著でした。
  • 脳は動画をテキストのようには保存できない:Mayerの「マルチメディア学習の認知理論」は、視聴覚コンテンツを長く定着させるために、なぜ書かれた要約へと変換する必要があるのかを説明しています。
  • 手作業の要約はより深い理解を育てる:要約を手で書くことは記憶を強める認知処理を促しますが、時間がかかり、継続するのが難しいものです。
  • AIツールで継続的な要約が現実的になるGlasp YouTube Summary のようなツールは、文字起こし、要点、タイムスタンプを数秒で生成し、能動的な学習へのハードルを下げます。
  • 最良のアプローチは両方の手法を組み合わせること:AIで下書きの要約を生成し、その要点を自分の言葉で書き直します。このハイブリッド手法は、自動化と能動的な処理の両方の利点を活かします。
  • 要約の習慣は時間とともに複利で効く:動画の要約をより広い知識ベースにつなげると、新しい動画のひとつひとつが、すでに知っていることを補強し、拡張していきます。

YouTube動画を要約する最速の方法

YouTube動画を要約するには、GlaspのYouTube Summary のような要約ツールをインストールし、任意の動画を開いて、AI要約ボタンをクリックします。数秒のうちに、タイムスタンプ付きの全文文字起こしと、要点を構造化した要約が手に入り、どのモデルに書かせるか(ChatGPT、Claude、Gemini、Mistral、Grok)を選ぶこともできます。URLをコピーする必要はなく、要旨をつかむために動画をすべて視聴する必要もありません。

何もインストールしたくない場合は、動画の文字起こしをコピーして、「この文字起こしをタイムスタンプ付きの5つの要点に要約して」といったプロンプトとともに任意のチャットボットに貼り付けます。どちらの方法でも機能します。本当の違いは手間です。専用ツールは要約、文字起こし、そして自分自身のハイライトを一箇所にまとめて保存してくれるため、動画は閉じて忘れてしまうタブではなく、あとから検索できるノートになります。

以下は、手間の少ない順に並べた最速の3つの方法です。

方法所要時間向いている用途
ワンクリック拡張機能(Glasp)約10秒日々の学習、知識ベースへの保存
文字起こしをチャットボットに貼り付ける1〜2分何もインストールできないときの単発の要約
手作業で要約する20〜40分重要な内容を深く学習するとき

このガイドの残りでは、それぞれの方法をいつ使うべきか、なぜ要約が受動的な視聴に勝るのかという研究、より良い要約を生み出す具体的なプロンプト、そして単発の要約を複利で積み上がる知識へと変える方法を扱います。


動画を要約することが学習において重要な理由

YouTubeには8億本を超える動画がホストされています。1分ごとに、クリエイターはさらに500時間分のコンテンツをアップロードしています。このプラットフォームを学習に使う人にとって、課題は情報を見つけることではありません。それを定着させることです。

動画を視聴していると、生産的に感じられます。議論を追い、うなずき、ときには気づきのひらめきさえ感じるかもしれません。しかし、研究は一貫して、この「理解した」という感覚が誤解を招くものであることを示しています。視聴した内容を処理する意図的な努力がなければ、コンテンツの大半は24時間のうちに記憶から消えてしまいます。1880年代以来何度も再現されてきたエビングハウスの忘却曲線は、積極的に記憶を保持しようとしなければ、新しい情報のおよそ70%を1日のうちに失うことを示しています。

要約は、最も効果的な対策のひとつです。動画を要約するとき、あなたは核となるアイデアを見極め、それを補足的な詳細から切り分け、自分にとって意味のある形に再構成することを強いられます。これは受動的な消費ではありません。構築です。そしてそれこそが、脳が長く残る記憶を形成するために必要なものなのです。

実用的なメリットは記憶の定着にとどまりません。

  • 時間の節約:良い要約があれば、30分の動画の要点を60秒で振り返れます。
  • 検索性:書かれた要約は検索できます。動画は(文字起こししない限り)検索できません。
  • 共有のしやすさ:動画をまるごと見てもらうよう頼むよりも、要約を同僚に送るほうがはるかに簡単です。
  • つながり:書かれた要約はノート作成システムに自然に統合され、動画、記事、書籍をまたいでアイデアを結びつけることが可能になります。

YouTubeから効果的に学ぶことを本気で目指すなら、要約は土台となるスキルです。


動画要約の背後にある科学

3つの研究分野が、なぜ要約が動画コンテンツにこれほど効果的なのかを説明しています。

Mayerのマルチメディア学習の認知理論

カリフォルニア大学サンタバーバラ校でのRichard Mayerの研究は、人が視覚と聴覚という2つのチャネルから学ぶことを明らかにしました。動画はその両方を同時に働かせるため、テキスト単独よりも豊かな初期符号化を生み出します。しかし、落とし穴があります。各チャネルには限られた容量しかなく、動画はあなたのペースではなく、話し手のペースで進むのです。

要約するとき、あなたは2チャネルの入力を、ひとつの整理された表現へと変換します。この翻訳の過程が、Mayerの言う「能動的な処理」、すなわち関連する情報を選択し、一貫した構造へと組織化し、既存の知識と統合することを強いるのです。この段階がなければ、情報は作業記憶にわずかにとどまり、そして薄れていきます。

生成的学習の方略

FiorellaとMayerによる2016年の生成的学習方略のレビューは、8つの具体的な技法、すなわち要約、マッピング、描画、イメージ化、自己テスト、自己説明、教える、演じる、についての数十年にわたる研究を分析しました。要約は、最も効果的で実践的な方略の中に一貫して位置づけられました。

重要な発見はこうです。要約を生成した学習者は、複数の研究にわたって、対照群を大きく上回りました。この効果は、学習者が元の素材から言い回しをそのまま写すのではなく、自分自身の言葉で要約を書いたときに最も強く現れました。言い換えはより深い意味的な処理を必要とし、それが記憶痕跡を強めるのです。

テスティング効果

検索練習(しばしば「テスティング効果」と呼ばれます)に関するRoedigerとKarpickeの研究は、情報を能動的に思い出すことが、同じ素材を再学習するよりも強い長期的な記憶の定着をもたらすことを示しています。記憶からの要約、つまり動画を一時停止して覚えていることを書き出す方法は、要約と検索練習の両方の利点を組み合わせたものです。

ある画期的な研究では、文章を学習したあとに検索練習を行った学生は、1週間後に要点の80%を思い出したのに対し、単に読み返しただけの学生は36%でした。動画学習に応用すると、一時停止して記憶から要約することは、見直すことのおよそ2倍効果的なのです。


手作業の手法:動画を手で要約する方法

AIツールが存在する前、人々は昔ながらのやり方で動画を要約していました。これらの手法は今でも通用し、重要なトピックを深く学ぶ場合には、なかなか敵うものがありません。

タイムスタンプ法

動画を通常速度で一度視聴します。話し手が新しいトピックに移ったり、要点を述べたりするたびに、タイムスタンプを記録し、一文の要約を書きます。終わるころには、動画全体の構造化されたアウトラインができあがります。

書式の例:

  • 0:00 - 導入:なぜ分散システムは失敗するのか
  • 2:15 - CAP定理の解説(一貫性、可用性、分断耐性)
  • 5:40 - 実例:Netflixはどのように分断障害に対処するか
  • 9:20 - 一貫性と可用性のトレードオフ

この手法は、講義、チュートリアル、カンファレンスの講演に適しています。セクションごとに一文を書くという規律が、核となるアイデアを見極め、余分なものを捨てることを強います。

コーネル式(動画向けに応用)

ノートのページを3つの区画に分けます。手がかりとなる語句のための狭い左列、メモのための広い右列、そして要約のための下部の区画です。

  1. 視聴中:右列に詳しいメモを書きます。要点、例、データを捉えます。
  2. 視聴直後:メモに対応する手がかり語や質問を左列に書きます。
  3. 24時間以内:右列を隠し、手がかり語だけを使って、ページの下部に記憶から要約を書きます。

3番目のステップこそ、本当の学びが起こる場所です。要約と検索練習を組み合わせています。

3層要約

複雑な、あるいは長い動画には、3層のアプローチを使います。

  1. 一文要約:この動画は何についてのものか、一文で表すと?
  2. 要点要約(3〜5個の箇条書き):主な主張や発見は何か?
  3. 詳細要約(1〜2段落):どの裏付けとなる証拠、例、ニュアンスが重要か?

これは複数の抽象度で考えることを強い、理解を強めます。


AIを活用した動画要約ツール

手作業の要約は効果的ですが、時間がかかります。20分の動画は、手作業で丁寧に要約すると30〜40分かかることもあります。週に何本もの教育的な動画を視聴する人にとって、その時間はすぐに積み重なります。

AIを活用したツールがこの方程式を変えました。文字起こしを生成し、要点を特定し、構造化された要約を数秒で作り出します。問題はそれらを使うかどうかではなく、受動的な消費に逆戻りせずにどう使うかです。

主要な選択肢を比較すると、次のようになります。

機能Glasp YouTube SummaryEightifyNotebookLMYouTube標準機能
文字起こしタイムスタンプ付きの全文文字起こし要点のみ動画をソースとしてインポート自動生成のキャプション
AIモデルChatGPT(GPT-5.5)、Claude(Opus 5、Sonnet 5)、Gemini、Mistral、Grok独自GeminiGemini
ハイライトあり、文字起こし内で色分けなしなしなし
インラインのメモあり、文字起こし上になしあり、ノートブック内になし
AIチャット / Q&Aあり、追加の質問ができるなしあり限定的
エクスポートMarkdown、HTML、CSV、JSON、Readwise限定的限定的なし
Web + PDFのハイライトあり(記事、PDFなど)なしソースのアップロードのみなし
カスタムプロンプトあり、要約の書式をカスタマイズ可能なし限定的なし
多言語対応あり、任意の言語で要約可能限定的あり限定的
料金無料週3本まで無料、有料は約$4.95/月から無料、上限引き上げは有料プラン無料だが限定的(Chromeの要約チップは有料のWorkspace)

最も重要な違いは機能一覧ではありません。そのツールが要約に取り組むことを促すのか、それとも単に消費させるだけなのか、という点です。ハイライト、注釈、エクスポートができるツールは、自然と能動的な処理へと導きます。要約だけを渡してそれ以外に何もしないツールは、読んで忘れることを容易にします。リサーチのためのワークスペースというアプローチをさらに詳しく知りたい場合は、2026年のNotebookLMNotebookLMの最良の代替ツールについてのガイドをご覧ください。

より良い要約を得るプロンプト

デフォルトの「この動画を要約して」というプロンプトでは、ありきたりの振り返りしか得られません。具体的なプロンプトは、実際に使える要約をもたらします。Glaspではカスタムプロンプトを設定でき、同じ言い回しは文字起こしを任意のチャットボットに貼り付けても機能します。一貫してより鋭い出力を生むものをいくつか挙げます。

  • 学習ノート向け:「この文字起こしを5〜7個の要点に要約して。それぞれにタイムスタンプと、平易な言葉での一文の説明を添えて。」
  • 意思決定向け:「この動画が示す具体的な推奨事項や手順を順番に列挙して。話し手が警告していることも書き添えて。」
  • 手早い選別向け:「3文で、この動画が何についてのもので、誰向けなのかを教えて。視聴するかどうか判断できるように。」
  • 深掘り向け:「一文の要約、次に5つの要点、そして最も強い論点とその主な弱点についての短い段落を出して。」

重要なパターンは、モデルに書式、長さ、そして要約で何をするつもりなのかを伝えることです。曖昧なプロンプトは曖昧な要約を生みます。


Glasp YouTube Summaryの使い方

Glasp は、YouTubeを構造化された学習プラットフォームに変える無料のブラウザ拡張機能です。最大限に活用するための、ステップごとのワークフローを紹介します。

ステップ1:インストールして開く

Chrome、Safari、Edge、Brave、Opera向けのGlasp拡張機能をインストールします。任意のYouTube動画に移動します。動画プレーヤーの隣にGlaspのサイドバーが表示され、タイムスタンプ付きの全文文字起こしが映し出されます。

ステップ2:AI要約を生成する

AI要約ボタンをクリックします。好みのAIモデル(GPT-5.5を使うChatGPT、ClaudeのOpus 5またはSonnet 5、Gemini、Mistral、Grok)を選ぶと、要約が数秒で生成されます。カスタムプロンプトを使って、要約の長さ、言語、書式をカスタマイズできます。

生成される要約には、通常次のものが含まれます。

  • 動画のトピックの簡単な概要
  • タイムスタンプ付きの要点
  • 言及された重要な引用やデータ
  • 結論または主な要点

ステップ3:動画と並べて文字起こしを読む

動画を何の準備もなく視聴するのではなく、まず文字起こしと要約に目を通します。これにより、再生を押す前にコンテンツの心的な地図が得られます。「先行オーガナイザー」に関する研究(Ausubel, 1960)は、新しい素材を学ぶ前に構造的な概観を持つことが、理解と記憶の定着を大きく高めることを示しています。

ステップ4:ハイライトして注釈をつける

視聴しながら(あるいは文字起こしを読みながら)、最も重要な箇所をハイライトします。それぞれの要点がなぜ自分にとって重要なのか、すでに知っていることとどうつながるのか、あるいはどんな疑問が生じるのかを説明する、自分自身のメモを加えます。こうした個人的な注釈こそ、受動的な要約が能動的な学習へと変わる場所です。

ステップ5:知識ベースにエクスポートする

ハイライトとメモを、好みのノート作成アプリにエクスポートします。GlaspはMarkdown、HTML、CSV、JSON形式に対応し、Readwiseとの直接連携も備えています。そこから、動画のメモを、Glaspのウェブハイライターで保存した記事、書籍、PDFのハイライトとつなげます。

この統合こそが、個々の動画要約を複利で積み上がる知識システムへと変えるものです。時間をかけて、つながり合った洞察の個人ライブラリを築いていくと、それはどんな単一の要約よりもはるかに価値のあるものになります。このアプローチは、セカンドブレインを構築する原則と一致しています。そこでは、取り込んだ知識のひとつひとつが、より大きく検索可能なシステムへと注ぎ込まれます。

ステップ6:追加の質問をする

GlaspのAIチャット機能を使って、動画の内容について質問します。ある概念がはっきりしなかったなら、より簡単な説明を求めます。動画が特定のサブトピックを扱っているかどうか知りたければ、ただ尋ねればよいのです。この対話的な層が、要約を静的な文書から動的な学びの会話へと変えます。


動画学習ワークフローを構築する

要約は、単発の活動としてではなく、より広いシステムの一部として機能するときに最もよく効きます。AIの効率性と、能動的な処理がもたらす認知的な利点を組み合わせた、実践的なワークフローを紹介します。

視聴の前に

  1. 目標を定める:どんな具体的な問いに答えようとしているのか?どんなスキルを学ぼうとしているのか?明確な目的があると、注意が集中します。
  2. 要約をプレビューする:Glaspを使ってAI要約を生成し、目を通します。その動画に時間を割く価値があるか判断します。多くの動画は要約だけで完全に理解できます。ほかの動画は特定のセクションの視聴が必要です。
  3. 長さを確認する:MITの研究は、6分を過ぎると関与が急激に低下することを示しています。動画が長い場合は、区切って視聴する計画を立てます。

視聴中

  1. 文字起こしの重要な箇所をハイライトする:すべてを捉えようとしないでください。核となる論点、意外なデータ、実行に移せる手順、そして自分が同意できない点に集中します。
  2. 個人的な注釈を加える:内容を既存の知識や目標と結びつける短いメモを書きます。
  3. 一時停止して思い出す:5〜10分ごとに一時停止し、メモを見ずに、今聞いたことを要約してみます。この検索練習は、利用できる中で最も効果的な単一の学習技法です。

視聴後

  1. 個人的な要約を書く:自分の言葉で、動画の主な論点と自分の要点を捉える3〜5文を書きます。この段階は、記憶の定着のために譲れません。
  2. 既存のメモとつなげる:要約を、記事、書籍、あるいはほかの動画の関連するハイライトにリンクします。相互参照は、読んだことや視聴したことを覚えておく助けとなる、相互につながった知識を築きます。
  3. スケジュールに沿って復習する:要約を1日後、次に3日後、そして1週間後に見直します。各復習はほんの数分ですが、記憶の定着を劇的に延ばします。

このワークフローは、動画1本あたり10〜15分ほど余計にかかります。しかしその投資に対する見返りは、実際に定着し使えるものという意味で、受動的な視聴に比べて計り知れないほど大きいのです。


よくある間違いとその避け方

間違い1:AI要約をゴールとして扱う

AI要約ツールで最もよくある誤りは、要約を読んで先に進んでしまうことです。AIが生成した要約は出発点であって、終着点ではありません。それに取り組まなければ(ハイライト、注釈、自分の言葉での書き直し)、ほとんど何も定着しません。

対処法:AI要約を読んだあと、それを閉じて、記憶から自分自身の3文版を書きます。そして比べます。AIの要約とあなたの要約の間のギャップが、あなたが完全には理解できていなかった点を正確に浮き彫りにします。

間違い2:すべてを要約する

すべての動画が詳しい要約に値するわけではありません。視聴するものすべてを要約しようとすると、燃え尽きて、システムを放棄することになります。選び抜きましょう。

対処法:詳しい要約は、目標、仕事、進行中のプロジェクトに直接関係する動画のために取っておきます。気軽な、あるいは探索的な視聴なら、個人的な注釈をつけない手早いAI要約で十分です。

間違い3:要約を二度と見返さない

二度と見返さない要約は、まったく要約しないのとほぼ同じ長期的な効果しかもたらしません。どれほど良いメモであろうと、見直さなければ忘却曲線は容赦しません。

対処法:週に15分の復習セッションを設けます。最近の要約にざっと目を通します。すでにどれほど忘れていたか、そして手短な復習でどれほど早く思い出せるかに、きっと驚くはずです。

間違い4:言い換えずに写す

手作業で要約するにせよ、AIが生成した要約を編集するにせよ、正確な言い回しをそのまま写すことは、要約を効果的にする認知処理を素通りしてしまいます。研究は一貫して、言い換えが逐語的な写しよりも良い記憶の定着をもたらすことを示しています。

対処法:あえて違う言葉を使うよう自分に課します。話し手が「分散システムは一貫性と可用性のトレードオフを必要とする」と言ったなら、「分散システムでは、完全な一貫性と100%の稼働時間の両方を得ることはできない」のように書きます。この翻訳の労力こそ、学びが起こる場所です。

間違い5:視覚情報を無視する

多くのYouTube動画は、図表、画面上のコード、実演、あるいは視覚的な例を通じて、重要な情報を伝えます。テキストだけの要約は、これらの要素をまるごと見落とします。

対処法:動画に重要な視覚情報が含まれるときは、要所でスクリーンショットを撮り、テキストの要約と並べてメモに含めます。あるいは、その視覚情報を自分の言葉で描写します。それはより深く処理することを強います。


よくある質問

YouTube動画を要約するのに最良のAIモデルは何ですか?

内容によります。OpenAIのGPT-5.5は、最も洗練された読みやすい要約を生む傾向があります。ClaudeのOpus 5とSonnet 5は、ニュアンスに富んだ長文の分析に優れ、長い文字起こしをうまく扱うため、学術的なコンテンツや数時間に及ぶ動画によく合います。Geminiは多言語コンテンツをうまく扱い、GrokとMistralは堅実な無料の選択肢です。Glaspではモデルを切り替えられるので、試しながら自分がよく扱うコンテンツに最も合うものを見つけられます。

YouTube動画を視聴せずに要約できますか?

はい、そして時にはそうすべきです。リサーチやコンテンツのキュレーションのためなら、AIが生成した文字起こしの要約を読むのは完全に妥当なアプローチです。1本を視聴する時間で、数十本の動画にざっと目を通せます。ただし、自分にとって重要なトピックを深く学ぶ場合は、文字起こしに取り組みながら要所を視聴するほうが、要約だけを読むよりも著しく良い記憶の定着をもたらします。

良い動画要約はどのくらいの長さであるべきですか?

ほとんどの動画では、元のコンテンツの長さの10〜20%(語数ベース)を目安にします。10分の動画(話される言葉でおよそ1,500語)は、150〜300語の要約としてうまくまとまります。それより短いと、重要なニュアンスを失う恐れがあります。それより長いと、何が重要かについて十分に選び抜けていないことを示唆します。

動画を2倍速で要約するのは有効ですか?

Applied Cognitive Psychology誌の2024年の研究は、再生速度を上げると記憶の定着が下がることを見いだしました。要約はこの効果を部分的に補いますが、速度を上げた視聴と要約の組み合わせは、通常速度での視聴に要約を加えたものよりも効果が低くなります。重要なコンテンツには、1倍速か1.25倍速にとどめましょう。

要約は、ただ文字起こしを読むこととどう違うのですか?

文字起こしを読むことは、テキストの受動的な消費です。要約は、情報を評価し、選択し、再構成することを求めます。FiorellaとMayerの2016年の研究は、要約を「生成的な」学習活動に分類しました。学習者が既存の情報を受け取るだけでなく、新しいものを生み出すことを求めるからです。この生成という行為こそが、より深い処理とより強い記憶形成を促すのです。

動画要約を仕事や学校のプレゼンテーションに使えますか?

もちろんです。動画要約は、プレゼンテーション、レポート、学習ガイドの優れた素材になります。ただし、元の動画を必ず引用し、重要な主張は独立して検証してください。AI要約は時折ニュアンスを見落としたり、詳細を誤って述べたりするので、公に使う予定のデータや引用はすべて相互確認しましょう。

どんな種類のYouTube動画が要約から最も恩恵を受けますか?

講義、チュートリアル、カンファレンスの講演、インタビュー、ドキュメンタリー風のコンテンツが最も恩恵を受けます。これらの形式は情報が密で構造化されているため、要約によく適しています。エンターテインメント、Vlog、そして視覚性の高いコンテンツ(旅行動画やアートのチュートリアルなど)は、その価値の多くが視覚体験そのものにあるため、テキストベースの要約からの恩恵は少なくなります。

YouTube動画を無料で要約できますか?

はい。GlaspのYouTube Summary は無料で、どんな動画でも全文文字起こしとAI要約を生成します。ChatGPT、Gemini、Grok、Mistralといった無料のチャットボットも、文字起こしを貼り付ければ動画を要約できます。一部の単体の要約ツールは無料利用に上限を設けているため(たとえばEightifyは週3本まで)、毎日動画を要約するなら、動画ごとの上限がないツールのほうが費用を抑えられます。

AIは1時間を超える長いYouTube動画を要約できますか?

はい、ただしモデルのコンテキスト上限が重要です。長い文字起こしは小さなモデルが受け付ける量を超えることがあり、そのため途中で切り詰めて末尾を見落とすことになります。大きなコンテキストウィンドウを持つモデル(Claude、Grok、Mistral、Google AI Studioはいずれも非常に長い入力を扱えます)は、数時間に及ぶ動画をより確実に要約します。2時間のポッドキャストや講義なら、これらのいずれかを選ぶか、何も抜け落ちないようにセクションごとの要約を求めましょう。


Glasp は、YouTube動画、ウェブ記事、PDFのコンテンツをハイライトして整理できる、無料のソーシャルウェブハイライターです。自分だけの知識ベースを築き、ほかの好奇心旺盛な人々が何を学んでいるかを発見しましょう。

Start building your knowledge library

Highlight what matters as you read across the web. Save insights from articles, books, and YouTube videos in one place.

Get Started Free