AI

ChatGPT로 유튜브 영상을 요약할 수 있을까?

ChatGPT는 영상을 볼 수 없습니다. 다만 읽을 수는 있습니다. 이 두 문장 사이의 차이가 링크만 붙여넣고 받아본 형편없는 요약을 전부 설명합니다.

15분 읽기
핵심 요점
    • ChatGPT는 영상을 보지 못합니다: 유튜브 링크만 붙여넣으면 ChatGPT가 보는 것은 제목과 설명문, 그리고 마크업으로 가득한 페이지뿐입니다. 나머지 요약은 영상이 아니라 패턴 매칭에서 나옵니다.
  • 자막 텍스트가 전부입니다: 실제로 말해진 내용을 그대로 건네주면 요약은 즉시 좋아집니다. 모델이 재구성하는 대신 읽기 때문입니다.
  • Gemini가 진짜 예외입니다: 구글은 Gemini API에서 유튜브 URL을 직접 지원한다고 공식 문서에 명시하고 있습니다. 공개 영상만 가능하며, API 무료 등급은 하루 영상 8시간이 상한입니다.
  • Atlas는 사라졌습니다: OpenAI의 브라우저는 2026년 8월 9일에 종료됐습니다. Atlas 안에서 영상을 요약하라고 알려주던 2025년 튜토리얼은 이제 전부 죽은 조언입니다.
  • 지어낸 타임스탬프가 신호입니다: 타임스탬프가 하나도 없던 텍스트에서 나온 요약이 타임스탬프로 가득하다면, 그것은 아무도 확인하지 않은 요약입니다.
  • 읽은 요약은 아는 지식이 아닙니다: 세 줄만 하이라이트하고 기억에 의존해 한 문장을 쓰십시오. 그러지 않으면 목요일쯤 그 영상은 머릿속에서 사라집니다.

결론부터 말하면

네, ChatGPT는 유튜브 영상을 요약할 수 있습니다. 다만 영상을 봐서 하는 것은 아닙니다. 일반 사용자용 ChatGPT 앱에는 유튜브 영상을 이해하는 기능이 내장돼 있지 않습니다. 영상을 열 수도, 화면을 볼 수도, 소리를 들을 수도 없습니다. ChatGPT가 할 수 있는 일은 영상의 자막, 즉 실제로 말해진 내용의 텍스트를 요약하는 것입니다. 그 텍스트를 붙여넣으면 요약은 정말로 쓸모 있어집니다. 대신 링크만 덜렁 붙여넣으면 그 영상이 아니라 그 주제에 관한 자신만만한 문단을 받게 됩니다.

이 구분이 인용할 수 있는 요약과 나중에 사과해야 하는 요약을 가릅니다. 2026년에 쓸 수 있는 경로는 다섯 가지이고, 신뢰도는 결코 같지 않습니다.

무엇을 하는가ChatGPT가 받는 것신뢰도
URL만 붙여넣기제목, 설명문, 페이지 메타데이터불안정하며 지어내는 경우가 많음
자막 텍스트 붙여넣기말해진 모든 문장안정적이며 기본이 되는 방법
자막 추출 확장 프로그램 사용자동으로 전달되는 자막 전문안정적이고 빠름
ChatGPT 자체 브라우저에서 질문그 순간 페이지에 보이는 내용자막 패널이 열려 있다면 안정적
음성을 직접 텍스트로 변환내가 만들어낸 자막안정적이며 자막이 없어도 작동

이 글의 나머지는 첫 번째 경로가 왜 실패하는지, 나머지 네 가지를 1분 안에 해내는 방법, 그리고 요약이 조용히 지어내고 있을 때 그것을 알아채는 법에 관한 이야기입니다.


링크를 붙여넣을 때 ChatGPT가 실제로 보는 것

언어 모델은 텍스트 조각인 토큰을 다룹니다. 일반 사용자용 ChatGPT 앱의 입력창에는 영상 디코더가 붙어 있지 않기 때문에, 영상 안의 어떤 것도, 픽셀도 오디오도, 모델이 읽을 수 있는 토큰이 되지 못합니다.

링크를 붙여넣으면 둘 중 하나가 일어납니다. 검색 단계가 아예 없어서 모델이 오직 URL 문자열과 학습 데이터만으로 답하거나, 아니면 브라우징 도구를 실행해 페이지를 가져옵니다. 두 번째 경우는 말처럼 좋지는 않습니다. 유튜브 시청 페이지는 플레이어와 자막 패널을 페이지가 로드된 뒤 브라우저에서 그려내므로, 수집기가 내려받는 HTML에는 제목과 설명문, 약간의 구조화된 메타데이터, 그리고 엄청난 양의 스크립트가 담깁니다. 말해진 내용은 쓸 만한 형태로 들어 있지 않습니다. 게다가 유튜브는 자동화된 수집을 막으려 애쓰기 때문에, 서버에서 가져온 결과는 화면에 보이는 것보다 훨씬 빈약하게 돌아오는 일이 잦습니다.

그다음 모델은 언어 모델이 하는 일을 합니다. 가장 그럴듯한 다음 문장을 만들어내는 것입니다. "간헐적 단식에 관한 이 영상을 요약해줘"의 가장 그럴듯한 이어짐은 간헐적 단식에 관한 잘 쓰인 에세이입니다. 유창하고, 구조가 잡혀 있고, 그 영상과는 상관이 없습니다. 사람들이 가장 흔하게 당하는 방식이 바로 이것이고, 결과물이 잘 쓰여 있기 때문에 어디에도 이상해 보이는 구석이 없습니다.

모델이 거짓말을 하는 것이 아닙니다. 읽어야 답할 수 있는 질문을 던져놓고, 읽을 것을 하나도 주지 않은 것입니다.


2026년에 통하는 네 가지 방법

방법 1: 유튜브가 제공하는 자막을 복사하기

영상을 열고 "...더보기"를 눌러 설명문을 펼친 다음, 맨 아래로 스크롤해 "스크립트 표시"를 누릅니다. 말해진 모든 문장과 타임스탬프가 담긴 패널이 열립니다. 데스크톱에서는 그 텍스트를 선택해 복사할 수 있습니다. 그것을 ChatGPT에 붙여넣고 한 줄짜리 지시를 덧붙이십시오. 예를 들면 "이 자막을 세 부분으로 요약해줘. 핵심 주장 한 문장, 가장 강력한 근거 세 가지, 화자가 확신이 없다고 말한 부분. 각 항목마다 해당 문장을 그대로 인용해줘." 정도면 됩니다. 아래에 더 나은 프롬프트가 있지만, 이것만으로도 쓸 만한 답을 얻기에는 충분합니다.

이 방법은 무료이고 설치할 것도 없으며, 다른 모든 방법은 결국 이 방법의 지름길일 뿐입니다. 걸림돌은 모바일입니다. 유튜브 앱의 패널에서 문장을 누르면 플레이어가 그 순간으로 이동하는데, 유용하기는 하지만 텍스트 자체는 선택되지 않아 붙여넣을 것이 없습니다. 모바일 브라우저에서 데스크톱 사이트를 요청하거나, Glasp 모바일 앱처럼 텍스트를 대신 가져와주는 도구를 쓰십시오. 유튜브 자막을 가져오는 방법 가이드에 모든 우회 방법을 정리해 두었습니다.

방법 2: 자막을 대신 넘겨주는 확장 프로그램

9,000단어짜리 자막을 손으로 복사하는 일은 금세 물립니다. 유튜브 페이지 위에 얹히는 브라우저 확장 프로그램은 자막을 가져와 곧바로 모델에 보내주며, 이 과정 전체를 클릭 한 번으로 줄입니다. Glasp의 YouTube Summary가 바로 그 일을 합니다. 클릭할 수 있는 타임스탬프가 붙은 구조화된 요약을 돌려주고, 그 옆에 자막을 그대로 두기 때문에 어떤 주장이든 그것을 만들어낸 문장과 대조해볼 수 있습니다. 자막만 먼저 보고 싶다면 Glasp의 자막 추출 도구가 URL에서 자막을 꺼내줍니다.

URL을 붙여넣는 웹사이트보다 확장 프로그램을 택할 이유는 속도가 아니라 검증입니다. 원문이 요약 옆에 있으면 틀린 주장을 몇 초 만에 잡아냅니다. 원문이 없으면 그 도구는 그냥 자기를 믿어달라고 요구하는 셈입니다.

방법 3: ChatGPT의 크롬 확장 프로그램 또는 데스크톱 브라우저

OpenAI가 브라우저 작업을 ChatGPT로 다시 흡수한 뒤로는, ChatGPT 크롬 확장 프로그램이나 데스크톱 앱에 내장된 브라우저에서 지금 보고 있는 페이지에 관해 물어볼 수 있습니다. 둘 다 요금제와 지역, 워크스페이스에 따라 달라지므로 해당 옵션이 보이지 않는다면 그 때문이고, 그럴 때도 방법 1은 그대로 통합니다. 유튜브 페이지에서는 조건이 하나 있습니다. 자막 패널을 먼저 열어야 합니다. 어시스턴트는 페이지에 있는 내용을 근거로 답하므로, 자막이 화면에 그려져 있으면 사용할 수 있습니다. 패널이 닫혀 있다면 다시 제목과 설명문에 기댄 추측으로 돌아가는데, 답변은 둘 중 무엇이 일어났는지 알려주지 않습니다.

방법 4: 음성을 직접 텍스트로 변환하기

자막 트랙이 아예 없으면 위의 어떤 방법도 통하지 않습니다. 가져올 텍스트가 없기 때문입니다. 그렇다면 만들면 됩니다. 다운로더로 오디오를 뽑아내고, Whisper 같은 음성 인식 모델에 넣은 다음(호스팅된 서비스를 쓰거나, 터미널이 편하다면 로컬에서 돌려도 됩니다) 나온 텍스트를 요약하십시오. 가장 느린 경로이지만, 아무도 자막을 달지 않은 영상에서 통하는 유일한 방법이고, 억양이 강하거나 전문 용어가 빽빽한 경우에는 유튜브 자동 자막보다 확실히 낫습니다.

방법준비 시간영상 한 편당 시간
유튜브 자막 복사없음약 1분
확장 프로그램최초 1회, 1분 이내약 10초
ChatGPT 확장 프로그램 또는 데스크톱 브라우저최초 1회, 1분 이내약 30초
오디오를 직접 변환보통몇 분

Atlas는 2026년 8월에 종료됐습니다. 그 자리를 대신한 것

2025년 말에 나온 튜토리얼을 따라 했다면, 아마 ChatGPT Atlas 안에서 하라고 안내받았을 것입니다. 그 조언은 더 이상 통하지 않습니다.

OpenAI는 2025년 10월 21일에 Atlas를 발표하고 macOS용으로 출시했습니다. 대표 기능은 "Ask ChatGPT" 사이드바였습니다. 별도의 대화창에 무언가를 복사해 넣지 않고도 지금 보고 있는 페이지에 관해 답해주는 기능이었고, 그래서 유튜브 문제에 대한 깔끔한 해답이 됐습니다. 영상을 열고, 사이드바를 열고, 물어보면 끝이었습니다.

Atlas는 출시 10개월이 채 되지 않은 2026년 8월 9일에 종료됐습니다. OpenAI는 독립 브라우저를 폐기하고 브라우저 기반 에이전트 작업을 ChatGPT와 Codex로 옮겼습니다. 구체적으로는 구글 크롬용 ChatGPT 확장 프로그램과 ChatGPT 데스크톱 앱의 내장 브라우저였고, 이쪽이 멀티탭 지원과 다운로드, 개선된 탐색, 계정 로그인 처리를 이어받았습니다. OpenAI는 종료 시점 전에 Atlas 북마크를 HTML 파일로 내보내 다른 브라우저로 가져가라고 안내했습니다. 열려 있던 탭과 방문 기록은 아예 옮겨지지 않았습니다.

현실적으로 옮기면 이렇습니다. 기능은 살아남았고, 제품은 살아남지 못했습니다. 오늘 유튜브 페이지에서 사이드바 경험을 원한다면 필요한 것은 크롬 확장 프로그램이나 데스크톱 앱의 내장 브라우저이지 Atlas가 아닙니다. 이 잦은 교체 자체가 교훈입니다. 10월에 브라우저 하나를 정의하던 기능이 이듬해 여름에는 다른 제품의 항목 하나가 됐습니다. 그때그때 최신인 도구에 기대기보다 자기 자막과 자기 노트를 직접 갖고 있어야 할 꽤 괜찮은 이유입니다.


Gemini는 영상을 볼 수 있습니다. ChatGPT는 여전히 못 합니다

두 거대 어시스턴트가 진짜로 갈리는 유일한 지점이고, 세부 사항이 중요합니다. "Gemini는 유튜브를 처리할 수 있다"는 말이 문서가 뒷받침하는 것보다 훨씬 자신 있게 반복되고 있기 때문입니다.

구글은 실제로 Gemini API에서 유튜브 URL을 직접 지원한다고 공식 문서에 명시하고 있습니다. 요청의 일부로 유튜브 URL을 API에 그대로 넘기면 모델이 멀티모달 이해 능력을 그 영상에 적용하며, 사용자 쪽에서 다운로드할 것은 없습니다. 2026년 9월 기준으로 공개된 제약은 다음과 같으며, 전부 일반 사용자용 Gemini 앱이 아니라 API에 적용되는 한계입니다.

제약구글이 명시한 내용
영상 공개 범위공개 영상만 가능, 비공개나 일부 공개 영상은 불가
무료 등급 상한API 무료 등급에서 하루 유튜브 영상 8시간 이내
유료 등급영상 길이에 따른 제한 없음
요청당 영상 수Gemini 2.5 이상에서 최대 10개, 이전 모델은 1개
프레임 샘플링정적 모드에서 초당 1프레임
오디오1 Kbps, 단일 채널로 처리되며 초당 약 32토큰
상태프리뷰, 현재 무료이며 가격과 요청 한도는 바뀔 가능성이 높음

프레임 샘플링 행을 다시 읽어보십시오. "본다"는 말의 한계가 거기서 정해지기 때문입니다. 초당 1프레임이면 모델은 움직임이 아니라 슬라이드쇼를 보고 있는 셈입니다. 주장은 잘 요약하겠지만, 빠르게 편집된 몽타주 안에서 시연이 몇 번 실패했는지에 대해서는 판단할 근거가 전혀 없습니다. 실제 신호의 대부분은 오디오와 자막이 실어 나르며, 이는 ChatGPT에서도 마찬가지입니다. 다만 가져오는 일을 대신 해준다는 점만 다릅니다.

그래서 선택은 단순해지는데, 언제나 Gemini 쪽으로 기우는 것은 아닙니다.

하고 싶은 일선택이유
링크만으로 가장 빠르게 요약하기Gemini API영상을 직접 가져오는 유일한 선택지
비공개나 일부 공개 영상 다루기ChatGPT에 자막을 붙여넣기Gemini의 URL 지원은 공개 영상만 가능
이후 한 시간 동안 후속 질문 이어가기ChatGPT에 자막을 붙여넣기전문이 맥락에 남아 다음 질문에 계속 쓰임
요약과 원문 문장과 내 노트를 함께 보관하기전용 도구두 챗봇 모두 영상을 일회성 질의로 취급함

어느 쪽도 결과물을 확인할 필요를 없애주지는 않습니다. 영상 한 편이 아니라 공부를 위해 어시스턴트를 고르는 중이라면, 학습용 Claude와 ChatGPT 비교가 실제 학습 과제를 놓고 둘을 맞붙입니다. 그리고 어떤 챗봇도 주지 않는 클릭 가능한 타임스탬프가 필요하다면, 2026년 최고의 유튜브 요약 도구에서 전용 도구들을 다룹니다.


쓸 만한 요약을 만들어내는 프롬프트

대부분의 사람이 쓰는 프롬프트는 "이거 요약해줘"입니다. 그러면 두서없는 문단이 돌아옵니다. 구조도, 길이도, 근거를 대라는 요구도 지정하지 않았기 때문입니다.

간직할 만한 프롬프트 세 가지입니다. 자막을 붙여넣은 다음 아래 중 하나를 덧붙이십시오.

강연이나 강의라면:

이 자막을 세 부분으로 요약해줘. 핵심 주장을 한 문장으로, 그 주장을 뒷받침하는 가장 강력한 근거 세 가지, 그리고 화자가 확신이 없다고 인정한 부분. 각 근거마다 자막의 해당 문장을 그대로 인용해줘. 자막에 없는 내용은 채워 넣지 말고 없다고 말해줘.

튜토리얼이라면:

이 자막을 발표자가 수행하는 동작의 번호 매긴 체크리스트로 바꿔줘. 순서대로, 한 줄에 하나씩, 명령형으로 써줘. 뭔가 잘못될 수 있다고 경고한 단계 옆에는 타임스탬프를 적어줘.

긴 인터뷰나 팟캐스트라면:

이 자막에 나오는 서로 다른 주제를 시작 타임스탬프와 함께 전부 나열해줘. 아직 요약하지는 마. 그다음 논의 시간이 가장 긴 세 주제만 요약해줘.

효과를 내는 것은 두 가지이고, 세 프롬프트 모두에 붙여 쓰는 편이 좋습니다. 첫째는 인용하라는 지시입니다. 원문 그대로의 문장을 내놓아야 하는 모델은 원문에 붙들리고, 문장을 찾지 못하면 그 사실을 말해야 하므로, 요약이 단언에서 확인 가능한 것으로 바뀝니다. 둘째는 "자막에 없다"고 말해도 된다는 명시적 허가입니다. 지어내야 한다는 압박을 없애줍니다.


무너지는 지점: 자막, 길이, 지어낸 타임스탬프

실패 유형은 다섯 가지입니다. 아예 발을 묶는 것부터 결과물을 조용히 오염시키는 것까지 순서대로 보겠습니다.

자막 트랙이 없는 경우. 자막이 전혀 없는 업로드가 있습니다. 음악, 일부 비영어권 업로드, 자막을 꺼둔 크리에이터, 방금 끝난 라이브 스트림 같은 것들입니다. 자막이 없다는 것은 스크립트가 없다는 뜻이고, 곧 텍스트가 없다는 뜻이며, 음성 인식을 제외한 모든 방법이 시작도 못 하고 끝난다는 뜻입니다.

지어낸 타임스탬프. 외워둘 만한 신호가 바로 이것입니다. 유튜브 자막 패널은 타임스탬프를 보여주지만, 그냥 복사하면 타임스탬프가 빠지는 경우가 있고 많은 자막 도구는 아예 제거해버립니다. 붙여넣은 텍스트에 타임스탬프가 없었는데 요약에는 가득하다면, 그 숫자는 전부 만들어진 것입니다. 그럴듯해 보일 것입니다. 간격도 자연스러울 것입니다. 그러나 그 숫자를 따라가도 설명된 장면은 나오지 않습니다.

길이. 사람이 보통 속도로 말하면 분당 약 150단어를 말하므로, 한 시간짜리 강연은 약 9,000단어, 세 시간짜리 팟캐스트는 27,000단어에 가깝습니다. 요즘 컨텍스트 윈도는 그 정도를 삼키지만, 삼키는 것과 주의를 기울이는 것은 다릅니다. Liu와 동료들(2024)은 Transactions of the ACL에 실린 "Lost in the Middle"에서, 관련 정보가 긴 입력의 맨 앞이나 맨 뒤에 있을 때 모델 성능이 가장 높고 중간에 묻히면 성능이 크게 떨어진다는 사실을 밝혔습니다. 긴 영상의 요약이 처음 10분과 마지막 5분에는 예리하면서 그 사이 한 시간에 대해서는 두루뭉술한 이유가 그것입니다. 컨텍스트 윈도가 좁은 작은 모델은 다른 방식으로 실패합니다. 뒷부분을 잘라내고 결말을 통째로 잃어버립니다. 두 메커니즘은 컨텍스트 로트와 롱 컨텍스트 검색에서 자세히 다뤘습니다. 현실적인 대응은 자막을 2,000단어에서 3,000단어 정도의 덩어리로 쪼개 각각 요약한 뒤, 그 요약들을 다시 요약하는 것입니다.

자막 오류. 자동 자막은 고유명사와 전문 용어, 숫자를 엉망으로 만듭니다. "Lee Kwan you"나 "10의 마이너스 9승" 같은 뭉개진 입력을 받은 모델은 그것이 이상하다고 알려주지 않고, 가장 그럴듯한 형태로 매끄럽게 다듬어버립니다. 이름과 수치야말로 나중에 인용하고 싶은 것들이므로, 그런 항목은 요약이 아니라 영상과 대조해 확인하십시오.

협찬 광고와 인트로. 자막에는 광고와 채널 홍보, 후원자 명단이 전부 들어 있습니다. 본문이 아닌 구간은 건너뛰라고 지시하지 않으면, 협찬이 붙은 영상의 요약은 매트리스에 관한 자신만만한 문단으로 시작할 수 있습니다.


30초 정확도 테스트

요약을 곧이곧대로 믿을 필요는 없습니다. 확인은 두 가지이고, 첫 번째가 30초짜리입니다.

먼저 인용 테스트입니다. 요약의 핵심 주장을 뒷받침하는 문장 하나를 영상에서 그대로 가져와 달라고 하십시오. 그런 다음 그 문장에서 특징적인 구절을 골라 자막에서 검색해보십시오. 그 문장이 있다면 모델은 읽고 있었던 것입니다. 없다면, 혹은 영상 말투와 똑같이 들리는데 어디에도 존재하지 않는 문장이 돌아왔다면, 그것은 재구성이며 그 요약에 담긴 나머지 주장도 똑같이 의심해야 합니다.

두 번째 확인은 함정 질문이고, 이쪽이 더 짓궂습니다. 영상에 아예 없는 것을 물어보십시오. 쿠버네티스를 한 번도 언급하지 않은 영상을 두고 "화자가 쿠버네티스에 대해 뭐라고 했지?"라고 묻는 식입니다. 근거에 충실한 모델은 그 이야기는 나오지 않았다고 답합니다. 그 외의 답이 돌아온다면, 그 도구가 모를 때 어떻게 행동하는지 정확히 알게 된 셈입니다.

새 도구나 새 작업 흐름을 처음 쓸 때 두 가지를 모두 돌려보고, 업데이트가 있고 난 뒤에 한 번 더 돌려보십시오. 기본 설정은 조용히 바뀌고, 지난달에는 근거에 충실했던 작업 흐름이 아무 말 없이 자막 가져오기를 멈출 수 있습니다. 요약이 검증을 통과했다면, 유튜브 영상을 요약하는 방법에서 프롬프트와 수동 방법, 그리고 요약을 기억에 남는 것으로 바꿔주는 복습 일정을 다룹니다.


요약이 학습이 아닌 이유

훌륭한 영상의 완벽한 요약조차, 다음 주에 내가 알고 있을 내용에는 거의 보탬이 되지 않습니다.

요약을 읽으면 학습한 것 같은 느낌이 듭니다. 유창하고 힘이 들지 않기 때문인데, 유창함은 기억 유지의 지표로는 악명 높을 만큼 형편없습니다. Dunlosky와 동료들(2013)은 Psychological Science in the Public Interest에서 흔히 쓰이는 학습 기법 열 가지를 검토하며 하이라이트와 밑줄 긋기를 낮은 효용으로 평가했습니다. "In most situations that have been examined and with most participants, highlighting does little to boost performance." (검토된 대부분의 상황에서, 그리고 대부분의 참가자에게서 하이라이트는 성적을 끌어올리는 데 거의 기여하지 않는다.) 가장 높은 평가를 받은 두 기법은 연습 시험과 분산 학습이었습니다. AI 요약을 수동적으로 읽는 일은 그 어느 쪽보다도 약합니다. 내 판단이 개입되는 유일한 부분, 즉 무엇이 중요한지 고르는 일이 이미 나 없이 끝나버렸기 때문입니다.

실제로 차이를 만드는 것은 요약을 읽은 뒤 2분 정도를 더 쓰는 일입니다.

  1. 자막에서 서른 줄이 아니라 세 줄만 하이라이트하십시오. 맞습니다. Dunlosky 팀은 하이라이트를 낮은 효용으로 평가했고, 그 이유는 대부분의 사람이 전부 다 칠하기 때문입니다. 세 줄이라는 엄격한 상한은 그 구도를 뒤집습니다. 다른 줄들을 버리지 않고는 한 줄도 표시할 수 없고, 그 버리는 행위가 바로 방금 요약이 나 대신 해버린 판단입니다.
  2. 다시 읽기 전에, 기억에 의존해 한 문장을 쓰십시오. 요약을 닫으십시오. 주장이 무엇이었습니까? 그 인출 시도가 기억을 만들며, 틀리게 떠올려도 효과가 있습니다. 이유는 능동적 인출에서 다룹니다.
  3. 영상이 답하지 않은 질문 하나를 적어두십시오. 다음번에 잡아당길 실마리가 생기고, 요약 더미가 실제 탐구의 흐름으로 바뀝니다.

Glasp의 웹 하이라이터는 바로 이 작업 흐름을 중심으로 만들어졌습니다. 자막이나 글에서 중요한 문장을 하이라이트하고, 그 옆에 내 노트를 붙여두고, 몇 달 뒤 대화 기록을 거슬러 올라가는 대신 모아둔 것을 통째로 다시 찾아내는 것입니다. Glasp의 하이라이트는 기본값이 공개이므로, 같은 영상에서 다른 사람들이 어떤 문장을 골랐는지도 커뮤니티에서 볼 수 있습니다. 내가 놓친 것을 빠르게 확인하는 방법입니다. 이 모든 것을 머리에 남기는 방법은 읽은 것을 기억하는 방법에 더 있습니다.


자주 묻는 질문

ChatGPT가 링크만으로 유튜브 영상을 요약할 수 있나요?

안정적이지는 않습니다. 자막이 없으면 제목과 설명문, 그리고 그 주제에 대한 자체 사전 지식으로 작업하므로, 답변은 영상이 아니라 주제를 설명하게 됩니다. 자막 텍스트를 붙여넣으면 그때 비로소 영상을 설명합니다.

유튜브용 ChatGPT 플러그인이나 확장 프로그램이 있나요?

OpenAI는 2024년 4월에 최초의 플러그인 스토어를 닫았습니다. 이름은 2026년 7월에 돌아왔습니다. OpenAI가 App Directory를 Plugin Directory로 바꾸면서였는데, 그 플러그인들은 스킬과 연결된 앱을 묶은 것이고 어느 것도 유튜브 페이지에 함께 얹히지는 않습니다. 그래서 유튜브를 위한 ChatGPT의 실질적인 답은 여전히 브라우저 확장 프로그램입니다. 페이지에서 자막을 뽑아 클릭 한 번으로 모델에 넘겨주는 방식이고, Glasp의 YouTube Summary가 하는 일이 정확히 그것입니다. 이 방식과 순수한 ChatGPT를 나란히 비교한 글도 있습니다.

ChatGPT로 유튜브 영상을 무료로 요약할 수 있나요?

네. 유튜브에 내장된 "스크립트 표시" 패널은 무료이고, ChatGPT 무료 등급도 붙여넣은 텍스트를 요약해줍니다. 유일한 실제 비용은 복사와 붙여넣기이며, 확장 프로그램이 그것마저 없애줍니다.

유튜브 영상 요약에 가장 좋은 프롬프트는 무엇인가요?

구조를 지정하고 인용을 요구하는 프롬프트입니다. 핵심 주장 한 문장, 가장 강력한 근거 세 가지와 각각에 해당하는 자막 원문, 그리고 자막에 없는 내용은 없다고 말해도 된다는 명시적 허가를 요청하십시오. 모델을 원문에 붙들어두는 것은 바로 인용 요구입니다.

자막이 없는 유튜브 영상도 ChatGPT가 요약할 수 있나요?

직접적으로는 불가능합니다. 읽을 텍스트가 없기 때문입니다. Whisper 같은 음성 인식 모델로 오디오를 먼저 텍스트로 옮긴 다음, 그렇게 만든 자막을 요약하십시오.

ChatGPT는 얼마나 긴 유튜브 영상까지 요약할 수 있나요?

긴 자막도 요즘 컨텍스트 윈도에는 들어가지만, 아주 긴 입력의 중간 부분에서는 정확도가 처집니다. 한 시간이 넘는 분량이라면 자막을 2,000단어에서 3,000단어 정도의 덩어리로 나눠 각각 요약한 다음, 그 요약들을 다시 요약하십시오.

유튜브에는 Gemini가 ChatGPT보다 나은가요?

유튜브 링크만 받아서 처리하는 특정한 작업에 한해서는 그렇습니다. 구글은 Gemini API에서 유튜브 URL을 직접 지원한다고 공식 문서에 명시하고 있으며, 공개 영상으로 제한되고 API 무료 등급은 하루 영상 8시간이 상한입니다. 요약 이후의 작업에서는 그 차이가 흔히 알려진 것만큼 크지 않습니다. 둘 다 대부분 오디오와 자막을 근거로 작동하기 때문입니다.

ChatGPT Atlas는 아직 쓸 수 있나요?

아니요. Atlas는 2026년 8월 9일에 종료됐습니다. OpenAI는 브라우저 기반 에이전트 작업을 크롬용 ChatGPT 확장 프로그램과 ChatGPT 데스크톱 앱의 내장 브라우저로 옮겼습니다.


결론: 근거가 추측을 이깁니다

ChatGPT로 유튜브 영상을 요약하는 믿을 만한 방법은 전부 하나의 발상을 변주한 것입니다. 진짜 텍스트를 모델 앞에 놓아주는 것입니다. 자막을 복사하거나, 대신 복사해주는 확장 프로그램을 쓰거나, 브라우저 어시스턴트에게 묻기 전에 자막 패널을 열어두거나, 자막이 없다면 텍스트를 직접 만들어내십시오. 잘못되는 모든 일은 같은 원인으로 되돌아갑니다. 지어낸 타임스탬프, 본 적도 없는 영상에 관한 자신만만한 에세이, 하마터면 인용할 뻔한 뭉개진 이름. 전부 한 번도 보여준 적 없는 것에 대해 보고하라고 요구받은 모델이 내놓은 결과입니다.

그런 다음 인용 테스트를 한 번 돌리십시오. 30초면 되고, 맞는 것처럼 들리는 요약과 나 사이에 서 있는 유일한 장치이기 때문입니다.

그리고 요약이 좋다면 거기서 멈추지 마십시오. 자막에서 세 줄을 뽑고, 기억에 의존해 한 문장을 쓰고, 영상이 남긴 질문을 적어두십시오. Glasp의 YouTube Summary는 자막과 타임스탬프와 하이라이트를 한곳에 모아주므로, 그 마지막 단계가 하려다 만 일이 아니라 2분이면 끝나는 일이 됩니다. 요약은 초고입니다. 직접 손대지 않은 초고를 기억하는 사람은 없습니다.

Start building your knowledge library

Highlight what matters as you read across the web. Save insights from articles, books, and YouTube videos in one place.

Get Started Free

Or highlight this page as you read it