戰(zhàn))
最近在做內(nèi)部培訓(xùn)平臺的視頻備份時(shí)發(fā)現(xiàn)很多現(xiàn)成的“視頻下載神器”要么失效要么捆綁廣告要么下載下來的文件根本打不開。與其到處找工具碰運(yùn)氣不如自己用 Python 寫一個(gè)夠用的下載器既能按需定制下載邏輯又能把請求頭、斷點(diǎn)續(xù)傳、流媒體分片合并這些細(xì)節(jié)掌握清楚。這篇文章會從視頻播放原理講起逐步拆解視頻真實(shí)地址的查詢方法再給出完整的 Python 下載代碼覆蓋普通 MP4 直鏈和 M3U8 流媒體兩種常見場景。無論是學(xué)習(xí)爬蟲、做離線備份還是純粹想提升 Python 文件處理能力這篇實(shí)戰(zhàn)教程都能給你一套可復(fù)用的方案。有一點(diǎn)必須提前說明本文所有技術(shù)僅用于學(xué)習(xí)交流與合法授權(quán)的內(nèi)容獲取請勿用于下載未授權(quán)或受版權(quán)保護(hù)的視頻內(nèi)容。1. 為什么需要自己寫“視頻下載神器”1.1 瀏覽器是怎么播放視頻的瀏覽器播放視頻時(shí)本質(zhì)上是做了一件很簡單的事向服務(wù)器發(fā)送 HTTP 請求拿到視頻文件的字節(jié)流然后交給視頻解碼器渲染。常見的視頻播放方式有兩種直鏈播放video標(biāo)簽的src直接指向一個(gè).mp4或.webm文件瀏覽器直接請求該文件并播放。流媒體播放播放器通過.m3u8索引文件獲取一串.ts分片地址逐個(gè)請求分片并順序播放看起來就像在播一個(gè)完整視頻。第一種情況下載視頻只需拿到直鏈 URL用代碼請求并保存。第二種情況則要解析 M3U8 文件、多線程或循環(huán)下載分片、最后合并。1.2 為什么現(xiàn)成下載工具總是不好用市面上的下載工具非常多但實(shí)際用起來總有各種限制圖形界面工具經(jīng)常內(nèi)置廣告彈窗下載大文件時(shí)還會限速或者強(qiáng)制引導(dǎo)用戶開通會員瀏覽器插件版本的下載器面對 M3U8 播放策略時(shí)容易抓不到完整地址部分站點(diǎn)對分片地址做了動(dòng)態(tài)簽名插件直接下載會導(dǎo)致 403部分下載器把“下載”做成了在線解析中轉(zhuǎn)視頻地址解析要經(jīng)過第三方服務(wù)器既慢又存在隱私風(fēng)險(xiǎn)。自己寫下載器最大的優(yōu)勢是邏輯透明、依賴可控遇到問題也能直接從代碼層面排查而不是被黑盒工具卡住。1.3 自己寫下載器需要掌握什么用 Python 寫一個(gè)視頻下載器核心技能點(diǎn)如下HTTP 請求與響應(yīng)處理。請求頭構(gòu)造尤其是 User-Agent、Referer、Cookie。文件流寫入與斷點(diǎn)續(xù)傳。M3U8 文件格式解析。多線程下載與文件合并。配合 FFmpeg 處理加密流或合并轉(zhuǎn)碼。這些技能單獨(dú)拿出來都是 Python 開發(fā)中的常見能力組合起來就是一個(gè)實(shí)用的下載工具。下面我們從環(huán)境準(zhǔn)備開始一步一步搭建。2. 環(huán)境準(zhǔn)備與基礎(chǔ)工具本文實(shí)戰(zhàn)部分使用 Python 和 FFmpeg建議在本地開發(fā)環(huán)境提前準(zhǔn)備好。2.1 Python 環(huán)境需要 Python 3.7 及以上版本主要使用標(biāo)準(zhǔn)庫urllib和第三方庫requests。在終端中執(zhí)行python --version pip --version如果你的環(huán)境沒有安裝requests執(zhí)行pip install requestsrequests是我們后續(xù)發(fā)起 HTTP 請求的主要庫它比標(biāo)準(zhǔn)庫urllib更簡潔處理請求頭、超時(shí)、Cookie 都非常方便。2.2 FFmpegFFmpeg 是一個(gè)強(qiáng)大的音視頻處理工具在本項(xiàng)目中有兩個(gè)作用合并 M3U8 下載下來的 TS 分片文件。將某些格式的視頻轉(zhuǎn)碼為 MP4。FFmpeg 的安裝方式根據(jù)系統(tǒng)不同有所區(qū)別# macOS brew install ffmpeg # Ubuntu / Debian sudo apt update sudo apt install ffmpeg # Windows # 從官網(wǎng)下載 release 版本并配置 PATH 環(huán)境變量安裝完成后驗(yàn)證ffmpeg -version如果能看到版本信息說明 FFmpeg 已經(jīng)就緒。2.3 requests 和 FFmpeg 的分工能力使用工具說明下載普通文件Python requests請求視頻直鏈并寫入本地文件下載 M3U8 分片Python requests循環(huán)請求 ts 分片保存為本地臨時(shí)文件合并分片F(xiàn)Fmpeg使用 concat 協(xié)議或 demuxer 合并 TS 文件轉(zhuǎn)碼封裝FFmpeg將 TS 轉(zhuǎn) MP4或?qū)⒁纛l視頻合并也可以選擇純 Python 方式合并 TS 分片但 FFmpeg 處理邊界情況如時(shí)間戳錯(cuò)亂、編碼不一致更可靠所以本文推薦使用 FFmpeg 完成合并環(huán)節(jié)。3. 找到視頻真實(shí)地址從網(wǎng)頁到直鏈在寫下載代碼之前必須先解決一個(gè)問題怎么獲取視頻的真實(shí)下載地址3.1 開發(fā)者工具查看網(wǎng)絡(luò)請求打開 Chrome 瀏覽器進(jìn)入目標(biāo)視頻頁面按下F12打開開發(fā)者工具切換到 Network 面板。點(diǎn)擊視頻播放按鈕然后在 Network 面板頂部的篩選器中輸入media可以看到視頻流請求如果是直鏈會出現(xiàn)一個(gè)type: media的請求URL 后綴通常是.mp4。如果是 M3U8 流會看到一個(gè)type: xhr或type: manifest的請求URL 后綴是.m3u8。點(diǎn)開這個(gè)請求在 Headers 頁面可以查看完整請求 URL 和請求頭信息。這些信息非常關(guān)鍵尤其是User-Agent、Referer和Cookie。3.2 為什么直接在瀏覽器訪問視頻 URL 會 403很多視頻站點(diǎn)開啟了防盜鏈機(jī)制。當(dāng)你直接把視頻 URL 復(fù)制到瀏覽器地址欄訪問時(shí)請求頭中缺少來源網(wǎng)站的Referer信息服務(wù)器就會拒絕請求返回 403。因此在下載代碼中我們需要模擬瀏覽器的請求頭將User-Agent和Referer等字段原樣帶上。一個(gè)常見的請求頭構(gòu)造如下headers { User-Agent: Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 Chrome/120.0.0.0, Referer: https://example-video-site.com/, }具體取值要從開發(fā)者工具中復(fù)制不能臆造。3.3 直鏈與 M3U8 的選擇視頻頁面中可能會出現(xiàn)多個(gè) media 請求按以下規(guī)則判斷如果后綴是.mp4且響應(yīng)體直接是視頻數(shù)據(jù)說明這是普通直鏈。如果后綴是.m3u8說明需要通過 M3U8 文件繼續(xù)請求分片。對于 M3U8 流還需要進(jìn)一步查看 M3U8 文本內(nèi)容。以text/plain或application/vnd.apple.mpegurl打開的請求響應(yīng)內(nèi)容形如#EXTM3U #EXT-X-VERSION:3 #EXT-X-TARGETDURATION:10 #EXT-X-MEDIA-SEQUENCE:0 #EXTINF:10.0, segment_000.ts #EXTINF:10.0, segment_001.ts其中每一行#EXTINF后面跟著的就是分片文件名需要拼接 M3U8 文件的目錄作為完整 URL。3.4 真實(shí)地址“失效”的原因有時(shí)候地址看起來有效但下載到一半就斷了或者下載到的文件無法播放。常見原因視頻地址帶動(dòng)態(tài)簽名簽名過期后 URL 失效服務(wù)器限制了單 IP 的并發(fā)連接數(shù)下載請求未攜帶正確的 Range 頭導(dǎo)致斷點(diǎn)續(xù)傳失敗M3U8 分片 URL 是相對路徑拼接錯(cuò)誤導(dǎo)致 404。這些問題我們會在后面的代碼和排錯(cuò)部分逐一處理。4. 實(shí)戰(zhàn)一下載普通 MP4 直鏈視頻我們先從最簡單的情況開始實(shí)現(xiàn)一個(gè)功能完整、代碼精簡的 MP4 下載器。4.1 最小可運(yùn)行版本創(chuàng)建文件download_mp4.py代碼如下import requests def download_mp4(url, save_path, headersNone): 下載普通 MP4 文件 :param url: 視頻直鏈 :param save_path: 本地保存路徑 :param headers: 請求頭可選 if headers is None: headers {} # 流式請求避免一次性加載到內(nèi)存 resp requests.get(url, headersheaders, streamTrue, timeout30) # 檢查響應(yīng)狀態(tài) if resp.status_code ! 200: print(f請求失敗狀態(tài)碼: {resp.status_code}) return False # 獲取文件總大小用于顯示進(jìn)度 total_size int(resp.headers.get(Content-Length, 0)) downloaded 0 with open(save_path, wb) as f: for chunk in resp.iter_content(chunk_size1024 * 1024): if chunk: f.write(chunk) downloaded len(chunk) if total_size 0: percent downloaded / total_size * 100 print(f下載進(jìn)度: {percent:.2f}%, end\r) print(f\n下載完成: {save_path}) return True if __name__ __main__: url https://example.com/video.mp4 save_path video.mp4 headers { User-Agent: Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 } download_mp4(url, save_path, headers)代碼說明streamTrue表示以流式方式讀取響應(yīng)不會一次性把整個(gè)視頻加載到內(nèi)存適合下載大文件。resp.iter_content每次迭代讀取一個(gè)指定大小的塊循環(huán)寫入本地文件。通過Content-Length計(jì)算下載進(jìn)度注意有些服務(wù)器不會返回該字段所以要做total_size 0判斷。用這段代碼配合開發(fā)者工具中獲取到的直鏈和請求頭即可下載大部分普通 MP4 視頻。4.2 添加斷點(diǎn)續(xù)傳支持如果視頻文件較大下載過程中網(wǎng)絡(luò)中斷會導(dǎo)致前功盡棄。我們可以通過 HTTP 的Range請求頭實(shí)現(xiàn)斷點(diǎn)續(xù)傳。Range: bytes1024-表示從第 1024 字節(jié)開始繼續(xù)下載。改進(jìn)后的代碼如下import os import requests def download_mp4_resume(url, save_path, headersNone): 支持?jǐn)帱c(diǎn)續(xù)傳的 MP4 下載 if headers is None: headers {} # 如果文件已存在記錄已下載大小 downloaded_size 0 if os.path.exists(save_path): downloaded_size os.path.getsize(save_path) # 從斷點(diǎn)處開始請求 resume_headers headers.copy() if downloaded_size 0: resume_headers[Range] fbytes{downloaded_size}- resp requests.get(url, headersresume_headers, streamTrue, timeout30) # 如果是 206說明服務(wù)器支持?jǐn)帱c(diǎn)續(xù)傳如果返回 200說明服務(wù)器忽略了 Range if resp.status_code not in (200, 206): print(f請求失敗狀態(tài)碼: {resp.status_code}) return False total_size int(resp.headers.get(Content-Length, 0)) downloaded_size mode ab if downloaded_size 0 else wb with open(save_path, mode) as f: for chunk in resp.iter_content(chunk_size1024 * 1024): if chunk: f.write(chunk) downloaded_size len(chunk) if total_size 0: percent downloaded_size / total_size * 100 print(f下載進(jìn)度: {percent:.2f}%, end\r) print(f\n下載完成: {save_path}) return True這里有兩個(gè)關(guān)鍵點(diǎn)使用ab模式打開文件表示追加寫入避免覆蓋已下載內(nèi)容。判斷服務(wù)器響應(yīng)狀態(tài)碼如果服務(wù)器不支持 Range會返回200而不是206此時(shí)需要重新從零開始下載上面的代碼保留了這種兼容后續(xù)可以根據(jù)實(shí)際需求補(bǔ)充邏輯。4.3 完整調(diào)用示例if __name__ __main__: video_url https://example.com/video.mp4 save_path downloads/demo.mp4 headers { User-Agent: Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36, Referer: https://example.com/, } os.makedirs(downloads, exist_okTrue) download_mp4_resume(video_url, save_path, headers)5. 實(shí)戰(zhàn)二下載 M3U8 流媒體視頻M3U8 是一種基于 HTTP 的流媒體傳輸方案常用于直播和長視頻點(diǎn)播。它的核心思路是把一個(gè)完整視頻切成很多小的 TS 分片文件播放器按順序請求播放。我們要做的就是把所有分片下載下來再合并成一個(gè)完整視頻。5.1 M3U8 文件結(jié)構(gòu)解析M3U8 本質(zhì)上是一個(gè)文本文件常見的字段有字段含義#EXTM3U文件頭表示這是一個(gè) M3U8 文件#EXT-X-VERSION協(xié)議版本號#EXT-X-TARGETDURATION單個(gè)分片最大時(shí)長#EXT-X-MEDIA-SEQUENCE分片序號起點(diǎn)#EXTINF分片時(shí)長下一行是分片地址#EXT-X-KEY加密信息如果存在則說明分片被 AES 加密#EXT-X-ENDLIST文件結(jié)束標(biāo)記無此標(biāo)記可能是直播流一個(gè)典型的 M3U8 文件#EXTM3U #EXT-X-VERSION:3 #EXT-X-TARGETDURATION:10 #EXT-X-MEDIA-SEQUENCE:0 #EXTINF:10.0, https://example.com/segments/segment_000.ts #EXTINF:10.0, https://example.com/segments/segment_001.ts #EXT-X-ENDLIST如果分片地址是相對路徑需要與 M3U8 地址的目錄部分拼接。例如 M3U8 地址是https://example.com/path/index.m3u8分片地址是segment_000.ts則完整地址是https://example.com/path/segment_000.ts。5.2 下載 M3U8 分片并合并創(chuàng)建一個(gè)新文件download_m3u8.py實(shí)現(xiàn)完整的下載流程import os import re import requests from urllib.parse import urljoin def download_m3u8(m3u8_url, save_path, headersNone): 下載 M3U8 流媒體視頻 :param m3u8_url: M3U8 地址 :param save_path: 最終保存的視頻文件路徑 :param headers: 請求頭 if headers is None: headers {} # 1. 請求 M3U8 文件 resp requests.get(m3u8_url, headersheaders, timeout30) if resp.status_code ! 200: print(fM3U8 文件請求失敗狀態(tài)碼: {resp.status_code}) return False m3u8_content resp.text # 2. 解析所有分片地址 segment_urls [] for line in m3u8_content.splitlines(): line line.strip() # 跳過注釋行 if line.startswith(#): continue if line: # 拼接絕對地址 segment_url urljoin(m3u8_url, line) segment_urls.append(segment_url) if not segment_urls: print(未找到任何分片地址請檢查 M3U8 內(nèi)容) return False print(f發(fā)現(xiàn) {len(segment_urls)} 個(gè)分片) # 3. 創(chuàng)建臨時(shí)目錄保存分片 temp_dir save_path _parts os.makedirs(temp_dir, exist_okTrue) # 4. 循環(huán)下載分片 for i, segment_url in enumerate(segment_urls): segment_path os.path.join(temp_dir, fsegment_{i:04d}.ts) try: seg_resp requests.get(segment_url, headersheaders, timeout30) if seg_resp.status_code 200: with open(segment_path, wb) as f: f.write(seg_resp.content) if (i 1) % 20 0 or i 1 len(segment_urls): print(f分片進(jìn)度: {i 1}/{len(segment_urls)}) else: print(f分片 {i} 下載失敗狀態(tài)碼: {seg_resp.status_code}) return False except requests.RequestException as e: print(f分片 {i} 下載異常: {e}) return False print(所有分片下載完成開始合并...) # 5. 使用 FFmpeg 合并分片 concat_file os.path.join(temp_dir, concat.txt) with open(concat_file, w) as f: for i in range(len(segment_urls)): segment_path os.path.join(temp_dir, fsegment_{i:04d}.ts) f.write(ffile {segment_path}\n) ffmpeg_cmd ( fffmpeg -f concat -safe 0 -i {concat_file} f-c copy -y {save_path} ) result os.system(ffmpeg_cmd) if result 0: print(f合并完成: {save_path}) # 清理臨時(shí)文件 import shutil shutil.rmtree(temp_dir) return True else: print(FFmpeg 合并失敗臨時(shí)文件保留在:, temp_dir) return False if __name__ __main__: m3u8_url https://example.com/path/index.m3u8 save_path output_video.mp4 headers { User-Agent: Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 } download_m3u8(m3u8_url, save_path, headers)這段代碼的核心流程請求 M3U8 文件讀取文本內(nèi)容。按行解析跳過#開頭的注釋行得到分片地址。使用urljoin正確處理相對路徑和絕對路徑。循環(huán)下載每個(gè)分片按序號保存在臨時(shí)目錄中。生成 FFmpeg concat 列表文件執(zhí)行合并命令。FFmpeg 文件名中的中文或特殊字符可能導(dǎo)致問題如果遇到合并失敗可以先把分片復(fù)制到純英文路徑再合并。5.3 使用多線程加速分片下載分片數(shù)量較多時(shí)逐個(gè)下載速度很慢。我們可以用 Python 的ThreadPoolExecutor實(shí)現(xiàn)并發(fā)下載。from concurrent.futures import ThreadPoolExecutor, as_completed def download_one_segment(segment_url, save_path): 下載單個(gè)分片 try: resp requests.get(segment_url, timeout30) if resp.status_code 200: with open(save_path, wb) as f: f.write(resp.content) return True except requests.RequestException as e: print(f分片下載異常: {segment_url} - {e}) return False def download_segments_concurrent(segment_urls, temp_dir, headersNone, max_workers5): 并發(fā)下載全部分片 tasks [] with ThreadPoolExecutor(max_workersmax_workers) as executor: for i, segment_url in enumerate(segment_urls): save_path os.path.join(temp_dir, fsegment_{i:04d}.ts) future executor.submit(download_one_segment, segment_url, save_path) tasks.append((i, future)) failed 0 for i, future in tasks: if not future.result(): failed 1 if (i 1) % 50 0: print(f已提交 {i 1}/{len(segment_urls)} 個(gè)分片任務(wù)) return failed 0使用多線程時(shí)要注意并發(fā)數(shù)不要太大一般 5 到 10 個(gè)線程足夠。過大容易觸發(fā)服務(wù)器限流反而導(dǎo)致部分分片下載失敗。將主流程中的下載循環(huán)替換為success download_segments_concurrent(segment_urls, temp_dir, headers, max_workers8) if not success: print(部分分片下載失敗請檢查網(wǎng)絡(luò)后重試) return False5.4 關(guān)于 M3U8 加密分片部分視頻源的 M3U8 文件中會有#EXT-X-KEY字段說明分片使用了 AES-128 加密。這種情況下還需要解析密鑰并解密分片。# 從 M3U8 內(nèi)容中提取密鑰地址 key_match re.search(r#EXT-X-KEY:METHODAES-128,URI([^]), m3u8_content) if key_match: key_url urljoin(m3u8_url, key_match.group(1)) key_resp requests.get(key_url, headersheaders, timeout30) key key_resp.content解密分片時(shí)使用pycryptodome庫的 AES 模塊from Crypto.Cipher import AES cipher AES.new(key, AES.MODE_CBC, key) # IV 默認(rèn)等于 key decrypted cipher.decrypt(segment_content)注意很多站點(diǎn)的 IV 并不是默認(rèn)值而是寫在#EXT-X-KEY字段中需要仔細(xì)解析。實(shí)際項(xiàng)目如果遇到加密流直接解密分片再合并會復(fù)雜一些更推薦直接用 FFmpeg 處理ffmpeg -allowed_extensions ALL -i https://example.com/index.m3u8 -c copy output.mp4FFmpeg 會自動(dòng)處理 AES 解密邏輯。6. 處理防盜鏈請求頭與 Cookie 實(shí)戰(zhàn)6.1 防盜鏈的原理服務(wù)器通過檢查Referer字段判斷請求來源。如果請求頭中的Referer不是預(yù)期站點(diǎn)服務(wù)器直接拒絕返回 403。6.2 構(gòu)造完整請求頭下載視頻時(shí)建議把開發(fā)者工具中的關(guān)鍵請求頭都帶上headers { User-Agent: Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 Chrome/120.0.0.0, Referer: https://example-video-site.com/, Origin: https://example-video-site.com, Accept: */*, Accept-Language: zh-CN,zh;q0.9,en;q0.8, }不要一次性把所有請求頭都搬過來重點(diǎn)是User-Agent、Referer和Cookie三個(gè)字段。6.3 處理需要登錄的視頻部分視頻需要登錄后才能播放。此時(shí)需要在請求頭中攜帶登錄后的 Cookie 信息cookies { session_id: xxxxxxxx, auth_token: yyyyyyyy, } resp requests.get(url, headersheaders, cookiescookies, streamTrue)在實(shí)際項(xiàng)目里更推薦從瀏覽器的開發(fā)者工具中直接復(fù)制Cookie字符串然后轉(zhuǎn)換成字典cookie_str session_idxxxxxxxx; auth_tokenyyyyyyyy cookie_dict dict(item.split(, 1) for item in cookie_str.split(; ) if in item)6.4 動(dòng)態(tài)簽名 URL 的處理思路有些播放地址會帶signature、token、expires等參數(shù)地址會過期。這種地址通常是從網(wǎng)頁的xhr請求中動(dòng)態(tài)獲取的。處理思路先用 Python 請求網(wǎng)頁或接口獲取視頻播放地址。再用獲取到的播放地址去下載視頻。如果播放地址有效期很短需要縮短從獲取到下載的時(shí)間間隔。示例思路# 1. 獲取播放地址接口 api_url https://example-video-site.com/api/video/playinfo payload {video_id: 123456} resp requests.post(api_url, jsonpayload, headersheaders) video_url resp.json()[data][video_url] # 2. 立即下載 download_mp4_resume(video_url, output.mp4, headers)這種接口的結(jié)構(gòu)每個(gè)站點(diǎn)都不一樣需要結(jié)合具體網(wǎng)頁的 Network 請求分析沒有統(tǒng)一的固定代碼。7. 常見問題與排查思路在下載過程中最常遇到的就是下面這幾種問題。這里整理成表格方便快速對照排查問題現(xiàn)象常見原因解決思路請求返回 403缺少 Referer 或 User-Agent被防盜鏈攔截從開發(fā)者工具補(bǔ)齊請求頭尤其是 Referer下載到幾十 KB 就結(jié)束請求到的內(nèi)容是錯(cuò)誤提示頁或 JSON不是真實(shí)視頻用文本編輯器打開文件檢查內(nèi)容確認(rèn) URL 是否正確M3U8 合并失敗分片路徑拼接錯(cuò)誤或分片不是 TS 格式檢查分片 URL 是否 200手工下載一個(gè)分片用 FFmpeg 探測FFmpeg 找不到文件concat 文件中路徑含中文或特殊字符使用純英文臨時(shí)目錄或調(diào)整 concat 文件路徑格式下載速度很慢單線程下載或服務(wù)器限速使用多線程并發(fā)下載分片控制線程數(shù)在 5-10 個(gè)M3U8 請求成功但無分片文件內(nèi)容可能是嵌套 M3U8或者接口返回了動(dòng)態(tài)內(nèi)容打印 M3U8 文本內(nèi)容查看是否有#EXT-X-STREAM-INF嵌套 M3U8 需要二次解析下載完成后視頻無法播放下載過程中缺分片或合并命令不對檢查分片下載成功率重新合并或改用-c copy參數(shù)播放地址過期動(dòng)態(tài)簽名 URL 有效期太短縮短解析和下載間隔將獲取地址與下載合并到一個(gè)腳本中請求報(bào) SSL 證書錯(cuò)誤服務(wù)器證書不受信任在測試環(huán)境可臨時(shí)關(guān)閉驗(yàn)證生產(chǎn)環(huán)境建議更新證書庫7.1 嵌套 M3U8 怎么處理M3U8 文件可能是多級結(jié)構(gòu)。頂層 M3U8 里不是分片而是多個(gè)不同清晰度的子 M3U8 地址#EXTM3U #EXT-X-STREAM-INF:BANDWIDTH1280000,RESOLUTION1280x720 https://example.com/path/720p/index.m3u8 #EXT-X-STREAM-INF:BANDWIDTH640000,RESOLUTION640x360 https://example.com/path/360p/index.m3u8遇到這種情況最簡單的處理方式是選擇分辨率最高的子 M3U8遞歸解析if #EXT-X-STREAM-INF in m3u8_content: # 找到最后一個(gè) STREAM-INF 后的 URL lines m3u8_content.strip().splitlines() # 從后往前找第一個(gè)非注釋行作為子 M3U8 地址 child_url None for line in reversed(lines): line line.strip() if line and not line.startswith(#): child_url urljoin(m3u8_url, line) break if child_url: m3u8_url child_url resp requests.get(m3u8_url, headersheaders, timeout30) m3u8_content resp.text7.2 斷點(diǎn)續(xù)傳導(dǎo)致文件損壞斷點(diǎn)續(xù)傳有一個(gè)隱藏陷阱如果服務(wù)器返回的Content-Length和本地已下載文件的長度不可靠會導(dǎo)致文件拼接出錯(cuò)。排查建議記錄 URL、文件總大小、斷點(diǎn)位置等日志方便復(fù)現(xiàn)。下載完成后校驗(yàn)文件大小是否等于Content-Length。如果服務(wù)器不支持 Range直接改為重頭下載。8. 最佳實(shí)踐與工程建議8.1 明確使用邊界寫視頻下載器的技術(shù)本身是中性的但使用時(shí)必須注意邊界只能下載自己有權(quán)限下載的內(nèi)容例如開源視頻、教學(xué)資料、公司內(nèi)部培訓(xùn)視頻等。不要批量下載他人版權(quán)內(nèi)容不要用于商業(yè)分發(fā)。涉及登錄態(tài) Cookie 時(shí)不要隨意泄露到公開倉庫。在代碼的 README 或注釋中加入合法使用聲明既是工程習(xí)慣也是保護(hù)自己的方式。8.2 控制并發(fā)與頻率對目標(biāo)服務(wù)器要設(shè)置合理的請求頻率避免造成服務(wù)器壓力過大。推薦做法普通 MP4 下載使用單線程即可。M3U8 分片并發(fā)控制在 5-10。使用time.sleep()在分片請求之間增加短暫延遲尤其是面對服務(wù)器限流時(shí)。設(shè)置requests超時(shí)時(shí)間避免線程長期卡住。8.3 日志與錯(cuò)誤處理下載大文件時(shí)最怕中斷后不知道卡在哪里。建立完善的日志輸出import logging logging.basicConfig( levellogging.INFO, format%(asctime)s [%(levelname)s] %(message)s, handlers[logging.StreamHandler()] )每次分片下載、文件合并、異常捕獲都通過logging輸出方便排查。8.4 使用臨時(shí)目錄與清理機(jī)制分片文件占用的磁盤空間可能很大建議下載過程中使用獨(dú)立臨時(shí)目錄。合并完成后立即清理臨時(shí)文件。異常退出時(shí)也要在finally中盡量清理避免垃圾文件堆積。try: download_segments(segment_urls) merge_video() finally: shutil.rmtree(temp_dir, ignore_errorsTrue)8.5 封裝成命令行工具為了方便復(fù)用可以把下載邏輯封裝成命令行工具使用argparse接收參數(shù)import argparse parser argparse.ArgumentParser(description視頻下載工具) parser.add_argument(--url, requiredTrue, help視頻地址或 M3U8 地址) parser.add_argument(--output, defaultoutput.mp4, help輸出文件路徑) parser.add_argument(--referer, default, helpReferer 請求頭) parser.add_argument(--concurrent, typeint, default5, help并發(fā)下載數(shù)) args parser.parse_args()這樣使用時(shí)只需要一條命令python video_downloader.py --url https://example.com/index.m3u8 --output demo.mp4 --concurrent 88.6 更多可靠的開源工具如果你不想從零搭建也可以直接使用開源社區(qū)成熟的命令行工具它們大多內(nèi)部封裝了 M3U8 解析、分片下載、解密、合并等能力。以常見的yt-dlp和ffmpeg組合為例可以直接處理大量網(wǎng)站的視頻下載場景。不過這類工具同樣要遵守目標(biāo)網(wǎng)站的使用協(xié)議且更新速度較快使用時(shí)建議從官方倉庫獲取最新版本。即使使用現(xiàn)成工具理解底層下載和合并原理仍然很有價(jià)值因?yàn)橛龅絾栴}時(shí)要能判斷是工具問題還是視頻源問題。9. 總結(jié)通過這篇文章你實(shí)際上已經(jīng)掌握了開發(fā)一個(gè)視頻下載工具所需的核心知識視頻網(wǎng)頁的請求過程以及如何通過開發(fā)者工具獲取真實(shí)地址。普通 MP4 直鏈的下載與斷點(diǎn)續(xù)傳。M3U8 流媒體文件解析、分片下載、并發(fā)加速與 FFmpeg 合并。防盜鏈、Cookie 和動(dòng)態(tài)簽名地址的處理思路。常見報(bào)錯(cuò)的排查方法。下一步可以繼續(xù)學(xué)習(xí)的方向包括更完善的命令行 UI 封裝、數(shù)據(jù)庫記錄下載任務(wù)、定時(shí)批量下載任務(wù)調(diào)度、以及如何給工具增加自定義文件命名規(guī)則。如果對流媒體協(xié)議感興趣還可以深入研究 HLS 加密機(jī)制、DASH 協(xié)議和 FFmpeg 的高級濾鏡用法。請?jiān)趧?dòng)手練習(xí)時(shí)始終把“授權(quán)”和“版權(quán)”放在第一位。技術(shù)沒有對錯(cuò)但使用技術(shù)的人需要清楚邊界。如果這篇文章對你有幫助可以收藏備用也歡迎在評論區(qū)分享你在實(shí)際下載過程中遇到的坑。