你的網(wǎng)站已經(jīng)上線了幾個(gè)月,但搜索引擎收錄的頁(yè)面數(shù)量始終只有個(gè)位數(shù),而內(nèi)容總頁(yè)面有幾百甚至上千。這不是搜索引擎針對(duì)你,而是你的網(wǎng)站很可能在三個(gè)關(guān)鍵環(huán)節(jié)上出了問(wèn)題:搜索引擎壓根不知道頁(yè)面存在、知道但爬不過(guò)來(lái)、爬了但決定不收錄。
一、先分清“沒(méi)索引”和“沒(méi)抓取”
在排查之前,你需要明確一個(gè)基本概念:收錄(索引) 是指頁(yè)面被搜索引擎存入其數(shù)據(jù)庫(kù)中,可以在搜索結(jié)果中出現(xiàn);抓?。ㄅ佬校?/strong> 是指搜索引擎的爬蟲(chóng)訪問(wèn)了頁(yè)面內(nèi)容。沒(méi)有被抓取就一定不會(huì)被收錄,但抓取了也可能不收錄。
判斷頁(yè)面處于哪個(gè)階段,最直接的方式是使用搜索引擎站長(zhǎng)工具(如 Google Search Console 的“網(wǎng)址檢查”工具或 Bing Webmaster Tools)。輸入一個(gè)未被收錄的網(wǎng)址,工具會(huì)告訴你該頁(yè)面是否已抓取、是否被編入索引,以及是否存在明確的排除標(biāo)記。
最常見(jiàn)的索引層阻斷
如果你發(fā)現(xiàn)頁(yè)面“已抓取但未編入索引”,搜索一個(gè)根本原因就是:搜索引擎認(rèn)為該頁(yè)面沒(méi)有足夠的價(jià)值進(jìn)入索引。與此并列的另一個(gè)高發(fā)原因則是你主動(dòng)或被動(dòng)地在代碼層面給出了“不要索引”的指令。優(yōu)先檢查以下三條:
noindex標(biāo)簽誤用:檢查頁(yè)面 HTML<head>中的<meta name="robots" content="noindex">或 HTTP 響應(yīng)頭X-Robots-Tag: noindex。許多網(wǎng)站在開(kāi)發(fā)環(huán)境中設(shè)置全局noindex,上線時(shí)忘了移除,導(dǎo)致整站零收錄。canonical標(biāo)簽錯(cuò)誤指向:<link rel="canonical" href="...">用于聲明頁(yè)面的權(quán)威版本。如果你把成百上千個(gè)詳情頁(yè)的 canonical 標(biāo)簽都指向了首頁(yè)或某個(gè)列表頁(yè),搜索引擎會(huì)認(rèn)為這些頁(yè)面只是重復(fù)內(nèi)容,只收錄你聲明的那個(gè)版本,其他頁(yè)面的收錄機(jī)會(huì)直接歸零。robots.txt徹底屏蔽:檢查robots.txt文件是否包含Disallow: /或阻止了關(guān)鍵目錄。被robots.txt屏蔽的頁(yè)面,爬蟲(chóng)根本不會(huì)訪問(wèn),也就無(wú)從判斷內(nèi)容質(zhì)量,但要注意:如果頁(yè)面同時(shí)被其他頁(yè)面的外部鏈接指向,搜索引致可能仍會(huì)將它添入索引(但不顯示摘要),造成“收錄了但沒(méi)排名”的假象。正確的做法是讓頁(yè)面可爬,再用noindex決定是否索引。
二、抓取預(yù)算被消耗在低價(jià)值頁(yè)面上
對(duì)于頁(yè)面數(shù)量較多的網(wǎng)站,抓取預(yù)算——即搜索引擎在一段時(shí)間內(nèi)愿意為你分配的爬行資源——是有限的。收錄少的另一個(gè)直接原因,是你的預(yù)算被大量低質(zhì)、重復(fù)或無(wú)用的 URL 消耗殆盡,導(dǎo)致優(yōu)質(zhì)頁(yè)面排不上隊(duì)等待被抓取。
你需要重點(diǎn)排查以下幾類(lèi)吞噬抓取預(yù)算的頁(yè)面類(lèi)型:
- 篩選和排序參數(shù)生成的無(wú)盡組合:電商或名錄站點(diǎn)中,顏色、尺碼、價(jià)格排序等參數(shù)組合會(huì)產(chǎn)生數(shù)百萬(wàn)個(gè) URL,而頁(yè)面主體內(nèi)容幾乎相同。你需要通過(guò)
robots.txt屏蔽這些參數(shù)路徑(而非頁(yè)面本身),或使用規(guī)范的 URL 參數(shù)處理功能(Google Search Console 中可設(shè)置參數(shù)忽略),同時(shí)為所有變體頁(yè)面設(shè)置正確的canonical標(biāo)簽指向主版本。 - 空值或無(wú)內(nèi)容的分頁(yè):某些分頁(yè)邏輯會(huì)為不存在結(jié)果的頁(yè)碼生成空白頁(yè)面,例如
/category/page/200/,爬蟲(chóng)一旦陷入這些“無(wú)窮空間”,就會(huì)反復(fù)抓取無(wú)效內(nèi)容。使用noindex或直接返回 404 狀態(tài)碼,并確保分頁(yè)序列只有最后一頁(yè)無(wú)內(nèi)容時(shí)才停止生成鏈接。 - 打印版、純文本版等冗余版本:如果你的站點(diǎn)存在
/print/、/amp/或其他格式的重復(fù)頁(yè)面,而它們?nèi)鄙僬_的canonical指向原網(wǎng)頁(yè),爬蟲(chóng)會(huì)把同一內(nèi)容抓取多次。這不僅稀釋預(yù)算,還可能因重復(fù)內(nèi)容導(dǎo)致原頁(yè)面被降權(quán)。
抓住一個(gè)核心原則:凡是不能獨(dú)立帶來(lái)搜索流量的頁(yè)面,都不要占用爬蟲(chóng)的注意力。
三、內(nèi)容被判定為“不應(yīng)收錄”的信號(hào)
即使技術(shù)配置無(wú)誤、抓取預(yù)算充足,搜索引擎仍可能拒絕將大量頁(yè)面加入索引。這通常是因?yàn)轫?yè)面被歸入了以下三類(lèi)低價(jià)值特征的集合:
- 薄內(nèi)容或不維護(hù)的內(nèi)容:頁(yè)面正文不足 200 字,且頁(yè)面上全是通用模板的導(dǎo)航、側(cè)邊欄和頁(yè)腳,正文被完全淹沒(méi)?;蛘唔?yè)面最初收錄了,但后來(lái)長(zhǎng)時(shí)間無(wú)更新,內(nèi)容變得無(wú)關(guān)緊要,搜索引致會(huì)周期性地將其從索引中剔除。你需要在核心內(nèi)容區(qū)域輸出足夠獨(dú)立、有具體信息的文本,并定期刷新關(guān)鍵頁(yè)面。
- 大規(guī)模復(fù)制或拼合的內(nèi)容:直接抓取競(jìng)品商品描述、廠家產(chǎn)品參數(shù)而不做任何差異化加工,或通過(guò)程序拼接而成的“關(guān)鍵詞堆砌”頁(yè)面,會(huì)在例行算法評(píng)估中被整體打上低質(zhì)標(biāo)記,不止單頁(yè)不收錄,還可能拖累整站的質(zhì)量評(píng)分。
- 缺少外部鏈接和內(nèi)部鏈接的孤立頁(yè)面:沒(méi)有被任何內(nèi)部導(dǎo)航鏈接到的頁(yè)面(俗稱(chēng)“孤島頁(yè)面”),以及從沒(méi)有獲得過(guò)任何外部鏈接(引用)的頁(yè)面,搜索引擎很難認(rèn)為它們是重要的。你需要確保每個(gè)希望被收錄的頁(yè)面至少有一條來(lái)自站內(nèi)其他已索引頁(yè)面的直接超鏈接,并在關(guān)鍵內(nèi)容上通過(guò)社交媒體或合作渠道獲取初始引用。
一個(gè)可立即執(zhí)行的排查流程
不要再憑感覺(jué)猜測(cè)。你可以按照以下順序走一遍自有站點(diǎn):
- 在站長(zhǎng)工具中提取一份“未索引頁(yè)面”報(bào)告,按原因分組,找出數(shù)量最多的那類(lèi)問(wèn)題先解決。
- 抽樣 10 個(gè)你想收錄但未收錄的頁(yè)面,用“網(wǎng)址檢查”工具逐一查看抓取和索引狀態(tài)。如果顯示“未抓取”,檢查這些頁(yè)面的爬取路徑是否被阻斷,或是否處于深層嵌套中。如果顯示“已抓取但未索引”,檢查內(nèi)容是否太薄、是否有重復(fù)版本,以及頁(yè)面是否有
noindex或指向其他頁(yè)面的canonical標(biāo)簽。 - 查看服務(wù)器日志(或 CDN 日志),聚焦搜索引擎爬蟲(chóng)的記錄。關(guān)注爬蟲(chóng)來(lái)自
Googlebot、Bingbot等標(biāo)識(shí)的請(qǐng)求,確認(rèn)它們是否高頻停留在/tag/、/category/等無(wú)限循環(huán)路徑上。如果日志中有大量對(duì)低價(jià)值 URL 的 200 狀態(tài)響應(yīng),說(shuō)明爬蟲(chóng)正在浪費(fèi)預(yù)算。 - 修復(fù)所有技術(shù)性錯(cuò)誤后,在站長(zhǎng)工具中對(duì)關(guān)鍵頁(yè)面手動(dòng)提交“請(qǐng)求編入索引”。但請(qǐng)注意,這只是通知搜索引擎頁(yè)面已更新,并不能保證收錄。收錄與否仍取決于頁(yè)面質(zhì)量。
網(wǎng)站收錄少很少是由單一原因造成的,通常是技術(shù)指令、信息架構(gòu)和內(nèi)容質(zhì)量三者共同失效的結(jié)果。與其研究黑帽“秘訣”,不如跑通這一套排查流程,你通常能在幾小時(shí)內(nèi)找到讓收錄量級(jí)卡住的那塊木板。