資料抓取與 API 串接的實務
先說明抓取前應確認的法律與道德界線與合理使用情境,涵蓋 robots.txt 的檢查、請求的三個必要設定、頻率控制與重試機制、HTML 解析、內容由前端產生的處理方向、API 串接的四個注意事項,以及自家網站的檢查腳本應用。
共 5 筆相關內容
先說明抓取前應確認的法律與道德界線與合理使用情境,涵蓋 robots.txt 的檢查、請求的三個必要設定、頻率控制與重試機制、HTML 解析、內容由前端產生的處理方向、API 串接的四個注意事項,以及自家網站的檢查腳本應用。
說明自動化的三個原則與只監控失敗不足的問題,提供 logging 設定、錯誤通知與結束碼、資料庫備份腳本的三個重點、過期檔案清理、日誌分析、排程的四個陷阱與防重複執行,以及模擬執行模式的重要性。
說明不要動系統內建 Python 的原因與虛擬環境的必要性,涵蓋套件管理與相依記錄的實務建議、版本選擇原則、專案目錄結構、敏感資訊不寫在程式碼中的做法,以及在伺服器執行時的路徑與權限注意事項。
處理中文 CSV 最常見的編碼問題:讓 Excel 正確開啟的做法、來源不明檔案的編碼判斷、Big5 轉換的字元缺漏處理,並涵蓋 DictReader 的使用、Excel 與 JSON 的讀寫要點、批次改檔名與大檔案的逐列處理。
涵蓋縮圖與壓縮的四個關鍵處理、批次處理整個資料夾、產生多種尺寸、轉換為新格式、處理前的現況檢查報告、移除含座標的 EXIF 資訊、加上浮水印,並強調輸出到新目錄等四個安全習慣與多行程的效能考量。
非必要類別在您開啟對應開關並儲存之前,不會寫入任何 Cookie。您隨時可以回到本面板變更或撤回。
維持瀏覽狀態、表單送出的安全驗證,以及記錄您在此處所做的選擇。停用將導致網站無法正常運作。
Google Analytics 4。統計頁面瀏覽與流量來源,資料以彙總形式呈現。
Google Ads。用於衡量廣告成效,以及在其他網站向您顯示本公司的廣告。
尚未記錄同意選擇。