你的站點上線半年,內(nèi)容已經(jīng)超過200篇,但搜索引擎只收錄了不到30個頁面,且收錄量連續(xù)幾周不再增長。你檢查過后臺,沒有手動作死;你確認過內(nèi)容,至少不劣于同行收錄過萬的站點。這時候問題通常不在內(nèi)容本身,而在系統(tǒng)性的可抓取性、索引預算分配和質(zhì)量閾值上。
抓取層:爬蟲根本看不到,或者不想多抓
收錄的第一步是讓搜索引擎的爬蟲(Googlebot、Baiduspider等)發(fā)現(xiàn)頁面并成功下載。收錄少最常見的原因之一就發(fā)生在這個環(huán)節(jié)。
1.1 技術(shù)屏障讓頁面不可達
- robots.txt 誤攔截:檢查
https://你的域名/robots.txt,確認沒有Disallow: /這類誤操作。尤其留意帶*的通配規(guī)則是否屏蔽了包含關(guān)鍵參數(shù)的URL。 <meta name="robots" content="noindex">或 HTTP頭X-Robots-Tag: noindex:很多CMS、SEO插件會在分類頁、標簽頁、搜索過濾頁上默認輸出noindex,當你把內(nèi)容重心放在這些頁面時,收錄就被禁掉了。- 規(guī)范鏈接(canonical)指向不一致:如果分頁、打印版、篩選版URL的
<link rel="canonical">都指向一個父級頁面,爬蟲通常只會收錄父級,其他URL會被判定為重復內(nèi)容而放棄索引。 - JS渲染問題:主要內(nèi)容和鏈接依賴客戶端JavaScript生成,而搜索引擎抓取分兩步(先抓HTML,再選擇性渲染)。如果你在Network面板里看到所有內(nèi)容通過XHR/GraphQL異步加載,爬蟲可能只拿到空殼HTML,認為頁面無價值。
1.2 抓取預算被低價值頁面耗盡
爬蟲給每個站點分配了抓取預算(crawl budget),即它會在一定時間段內(nèi)抓取多少頁面。當你的站點在抓取日志中顯示出大量低質(zhì)量、重復或快速響應的頁面時,預算會被迅速消耗,導致核心內(nèi)容來不及被抓取。典型低價值頁面包括:
- 篩選組合產(chǎn)生的海量URL,如
/products?color=red&size=xl&page=7; - 空分類、空標簽產(chǎn)生的無內(nèi)容歸檔頁;
- 搜索內(nèi)鏈產(chǎn)生的無限空格參數(shù)頁。
排查方式:在服務器日志中統(tǒng)計被爬蟲抓取的狀態(tài)碼200頁面,對比URL模式。如果 /tag/ 路徑抓取占比超過40%,而關(guān)鍵文章路徑不足20%,問題就很明顯。
1.3 站點架構(gòu)讓爬蟲找不到新頁面
爬蟲主要通過鏈接發(fā)現(xiàn)新URL。如果你的內(nèi)容沒有從首頁、分類頁、sitemap中得到足夠的內(nèi)鏈權(quán)重傳遞,頁面會被判定為“孤島”。僅靠XML sitemap提交是不夠的,sitemap是輔助渠道,不能替代站內(nèi)鏈接結(jié)構(gòu)。
索引層:頁面抓到了,但被搜索引擎判定不值得展示
頁面被抓取后,會進入索引管道進行質(zhì)量和相關(guān)性評估。大量頁面在這個階段被放棄,這就是“抓取了但不索引”。在Google Search Console的“索引——頁面”報告中,你會看到“已抓取-當前未編入索引”“重復網(wǎng)頁(未選定任何規(guī)范網(wǎng)頁)”“軟404”等分類。
2.1 內(nèi)容質(zhì)量信號過低
搜索引擎通過多維信號判斷一個頁面是否應該進入主索引,其中“有用內(nèi)容”評估越來越重要。以下情況會直接導致索引被拒:
- 內(nèi)容過薄:正文有效文字少于300字符,或者只是產(chǎn)品參數(shù)羅列、嵌入視頻加一句話摘要。
- 重復內(nèi)容(重復頁面):大規(guī)模模板化生成的頁面,僅替換了地名、商品型號,正文高度雷同。搜索引擎可能只索引其中一個作為規(guī)范版本,其余全部丟棄。
- 信息增益為零:你的頁面對某個查詢的全部核心信息都已經(jīng)在索引中的其他高權(quán)重頁面覆蓋,沒有新增數(shù)據(jù)、觀點、驗證或本地化視角,文章被判定為不需要索引。
2.2 實體、結(jié)構(gòu)化數(shù)據(jù)與話題權(quán)威性缺失
對于競品高收錄的行業(yè),僅僅“寫一篇原創(chuàng)文章”不夠。搜索引擎會評估頁面所屬域在這些話題上的歷史表現(xiàn)。如果你的站點是新域,且內(nèi)容孤島化(沒有形成內(nèi)容簇,沒有內(nèi)部話題鏈接網(wǎng)絡),索引階段就會傾向保守收錄。
此外,缺少關(guān)鍵結(jié)構(gòu)化數(shù)據(jù)(Schema.org標記)不會直接導致不收錄,但會降低頁面在索引管道中被正確歸類的效率。比如一篇詳細的產(chǎn)品評測,如果沒有 Product、Review 標記,搜索引擎可能無法準確判斷頁面類型并推遲索引。
2.3 被手動操作或算法打擊
如果網(wǎng)站曾經(jīng)參與過鏈接農(nóng)場、黑帽隱藏內(nèi)容或者大規(guī)模AI生成低質(zhì)內(nèi)容,搜索引擎可能對整個域名施加索引限制。表現(xiàn)為新內(nèi)容發(fā)布后幾天甚至幾周都不索引,但日志顯示爬蟲已經(jīng)抓過。這是最棘手的狀況,本質(zhì)上是信任度重置。
恢復收錄的診斷流程與行動建議
不要盲目增加內(nèi)容。在執(zhí)行任何操作前,先做三個基線檢查:
- Search Console覆蓋率報告:逐類查看“已抓取-未編入索引”“被 robots.txt 屏蔽”“找不到(404)”等條目,導出URL列表并歸類。
- 服務器日志抽查:下載最近3天被爬蟲訪問的記錄,按 URL 路徑聚合,找出抓取量最高和最低的目錄。
- 抽樣頁模擬抓取:使用移動端爬蟲模擬器(如Google的URL檢查工具)查看渲染后的HTML,確認核心文本和鏈接是否可見。
短期操作(1-2周內(nèi)生效)
- 收緊可索引范圍:將篩選頁、空分類頁、內(nèi)部搜索頁全部標記
noindex, follow或通過robots屏蔽,把抓取預算明確讓渡給內(nèi)容頁和核心欄目頁。 - 修復技術(shù)屏障:移除所有誤加的 noindex 指令;修正 canonical 指向;確保每個有價值頁面在站內(nèi)有至少3條來自同話題相關(guān)內(nèi)容的內(nèi)鏈。
- 優(yōu)化頁面信息量:對“已抓取-未編入索引”的頁面,充實正文到800字以上,補充原創(chuàng)數(shù)據(jù)、對比表格、實際案例。消除與站內(nèi)其他頁面的內(nèi)容重合度。
中期策略(1-3個月)
- 構(gòu)建話題集群:圍繞核心關(guān)鍵詞創(chuàng)建pillar頁面,并將相關(guān)子文章全部鏈回pillar頁面,形成清晰的內(nèi)容層級。這能向索引系統(tǒng)傳遞“本域在該話題有體系化覆蓋”的信號。
- 提升頁面交互信號:在頁面中嵌入交互組件,比如計算器、問答、配置器,增加用戶停留和操作,間接提高頁面質(zhì)量評估值。
- 獲取高質(zhì)量外鏈與品牌提及:這不是為了直接增加收錄,而是提升域的整體爬取優(yōu)先級。一個新頁面從高優(yōu)先級域被鏈接,其索引速度通常從數(shù)周縮短到幾小時。
需要避免的操作
- 不要用刷新Sitemap或手動提交索引功能反復提交同一個URL來“催促”收錄,這不會改變索引決策,反而可能觸發(fā)反濫用機制。
- 不要在發(fā)現(xiàn)收錄停滯時一次性發(fā)布大量內(nèi)容,這會被異常檢測為內(nèi)容工廠行為,導致全站索引減速。
- 不要為每張圖片、每個裁剪尺寸創(chuàng)建獨立頁面,除非你真的為每個版本提供了獨立的文本價值。
收錄少不是一個單一原因,而是一個分層結(jié)果:先看頁面是否可達,再看抓取預算是否被浪費,最后檢查索引層的質(zhì)量判定。按照這個順序排查,你能在兩天內(nèi)定位到真正的瓶頸。