一個功能強大的漫畫圖片爬取和自動下載工具,支持多種下載模式和CSV導出功能。
- 智能圖片爬取: 使用Selenium自動化瀏覽器,支持多種圖片元素類型
- 自動下載模式: 爬取完成後直接下載圖片,無需額外步驟
- CSV導出: 將圖片信息導出為CSV文件,支持後續批量下載
- 多種圖片類型支持: img標籤、canvas、背景圖片、SVG、picture標籤等
- 智能文件名生成: 自動提取漫畫標題,生成有意義的文件名
pip install -r requirements.txtselenium: 瀏覽器自動化requests: HTTP請求Chrome瀏覽器+ChromeDriver: 瀏覽器驅動
目前僅針對 ganma.jp,可供下載
python manga_browser_scraper.py -u "漫畫網址" --auto-download --output-dir "目標資料夾"參數說明:
-u, --url: 漫畫頁面URL(必需)--auto-download: 啟用自動下載模式--output-dir: 圖片保存目錄(默認: downloaded_images)--headless: 無頭模式,不顯示瀏覽器窗口--wait: 頁面加載等待時間(秒,默認: 5)--delay: 下載延遲時間(秒,默認: 0.5)
示例:
# 基本自動下載
python manga_browser_scraper.py -u "https://ganma.jp/comic/123" --auto-download --output-dir "目標資料夾"
# 自定義輸出目錄和延遲
python manga_browser_scraper.py -u "https://ganma.jp/comic/123" --auto-download --output-dir "my_manga" --delay 1.0
# 無頭模式(後台運行)
python manga_browser_scraper.py -u "https://ganma.jp/comic/123" --auto-download --headlesspython manga_browser_scraper.py -u "https://ganma.jp/..."這種方式會:
- 爬取頁面中的所有圖片
- 生成CSV文件(包含圖片URL、類型、屬性等)
- 保存到
output/目錄
python download_form_csv.py然後按提示輸入:
- CSV文件路徑
- 輸出目錄
- 下載延遲時間
my_manga_images/
├── 漫畫標題_img_001.webp
├── 漫畫標題_img_002.webp
├── 漫畫標題_canvas_003.png
└── ...
output/
├── manga_detailed_ganma.jp_20241201_143022.json # 詳細JSON數據
├── manga_simple_ganma.jp_20241201_143022.txt # 簡化文本報告
└── manga_images_ganma.jp_20241201_143022.csv # 圖片信息CSV
CSV文件包含以下列:
index: 圖片索引type: 圖片類型(img_tag, canvas, background_image, svg, picture, js_extracted)url: 圖片URLalt: 圖片alt屬性title: 圖片title屬性width: 圖片寬度height: 圖片高度class: CSS類名id: 元素IDmanga_title: 漫畫標題page_title: 頁面標題extract_time: 提取時間
在 manga_browser_scraper.py 中修改:
headers = {
'User-Agent': '你的User-Agent',
'Referer': '你的Referer',
'Accept': 'image/webp,image/apng,image/*,*/*;q=0.8'
}# 增加頁面加載等待時間
python manga_browser_scraper.py -u "..." --wait 10
# 增加下載延遲
python manga_browser_scraper.py -u "..." --delay 2.0- 網絡延遲: 建議設置適當的下載延遲,避免被網站封鎖
- 文件命名: 文件名會自動清理非法字符,長度限制為30字符
- 瀏覽器要求: 需要安裝Chrome瀏覽器和對應版本的ChromeDriver
- 圖片格式: 支持常見圖片格式(jpg, png, webp, gif等)
A: 檢查網絡連接,嘗試增加延遲時間,或檢查圖片URL是否有效
A: 網站可能沒有標準的標題結構,程序會自動使用頁面標題或域名
A: 確保已安裝Chrome瀏覽器和ChromeDriver,版本要匹配
A: 可以寫一個簡單的腳本循環調用,或使用批處理文件
- v2.0: 整合自動下載功能,支持CSV導出
- v1.0: 基礎圖片爬取功能
歡迎提交Issue和Pull Request來改進這個工具!
本項目僅供學習和研究使用,請遵守相關網站的使用條款。