
搜尋引擎怎麼抓取與收錄網站?
搜尋引擎的三個階段
要理解技術 SEO,先要知道搜尋引擎在做什麼。整個過程分三步:
- 檢索(Crawl)——爬蟲程式(俗稱網路蜘蛛)沿著連結發現並讀取網頁
- 索引(Index)——分析內容,判斷主題與品質,決定是否納入資料庫
- 排名(Serve)——有人搜尋時,從資料庫中選出最合適的結果排序呈現
三個階段是依序的。 沒有被檢索就不會被索引,沒有被索引就不可能出現在搜尋結果——不論內容多好。
這也是技術 SEO 的核心價值:它不負責讓內容變好,而是確保好內容能被看見。
爬蟲怎麼發現你的頁面
- 從其他網站的連結過來——最主要的途徑
- 從你網站內部的連結——首頁連到分類、分類連到內頁
- 從網站地圖檔案——主動提交的頁面清單
- 推測網址結構——例如依序號規則嘗試相鄰的編號
第二項是最容易被忽略的。沒有任何連結指向的頁面(孤島頁面),爬蟲很難發現,見網站結構與內部連結怎麼影響 SEO。
阻擋檢索與阻擋收錄是兩件事
這是技術 SEO 最常見的誤解,而且用錯會造成完全相反的結果。
| robots.txt 阻擋 | noindex 標記 | |
|---|---|---|
| 作用 | 請爬蟲不要讀取這一頁 | 讀取了但請不要收錄 |
| 能否保證不出現在搜尋結果 | 不能 | 可以 |
| 適用 | 節省抓取資源、避免無意義的路徑 | 確實不希望被搜到的頁面 |
為什麼 robots.txt 不能保證
被 robots.txt 阻擋的頁面,爬蟲不會讀取內容。但如果其他網站連到它,搜尋引擎仍可能知道這個網址存在並收錄——只是沒有內容描述。
更麻煩的是:如果一頁同時被 robots.txt 阻擋又設了 noindex,noindex 反而失效——因為爬蟲讀不到那個標記。
結論:真的不想被收錄,用 noindex,不要用 robots.txt 阻擋。
抓取預算的概念
搜尋引擎對每個網站分配的抓取資源是有限的。影響因素包含網站的規模、更新頻率、伺服器回應速度與整體評價。
對小型網站來說這通常不是問題。但內容量大的網站要注意:
- 伺服器回應慢,同樣時間內能抓的頁面就少
- 大量無意義的網址(篩選參數的各種組合)會消耗資源
- 大量錯誤頁面與轉址鏈也會浪費
- 結果是新頁面被收錄的速度變慢
速度對抓取的影響見網站速度為什麼重要。
怎麼確認自己的頁面被收錄了
- 在搜尋引擎搜尋該頁的完整網址——有出現就是被收錄了
- 用 Search Console 的網址檢查功能——最準確,還會說明未收錄的原因
- 看 Search Console 的涵蓋範圍報表——整站的收錄狀況一覽
如果重要頁面沒被收錄,常見原因:
- 被 noindex 或 robots.txt 阻擋
- 沒有任何內部連結指向它
- 正規網址指向了其他頁面
- 內容太少或與其他頁面高度重複
- 網站太新,還沒被完整抓取
最嚴重的一種失誤
測試期間的封鎖設定被帶到正式站。
測試站通常會設定不允許檢索,若上線時忘記解除,整個網站不會被收錄——網站正常運作,但搜尋不到,而且可能兩三個月後才被發現。
這是改版最常見也最嚴重的失誤,驗收時務必列入檢查。詳見網站改版或更換網域,SEO 排名怎麼保住。
刪除頁面要謹慎
已經被收錄的頁面若直接刪除,會產生兩個損失:
- 從搜尋結果點進來的人看到錯誤頁面,這個曝光機會就消失了
- 搜尋引擎持續撞到失效頁面,對整站的評價有負面影響
正確做法是轉向到相近的內容,或明確回傳「已永久移除」的狀態。處理方式見技術 SEO 的常見問題排查。