搜索引擎支持的robots使用方法記錄包括:
Disallow - 告訴蜘蛛不要抓取某些文件或目錄。如下面robots代碼將阻止蜘蛛抓取所有的網(wǎng)站文件:
User-agent: *
Disallow: /
Allow - 告訴蜘蛛應(yīng)該抓取某些文件。Allow和Disallow配合使用,可以告訴蜘蛛某個(gè)目錄下,大部分都不抓取,只抓取一部分。如下面robots代碼將使蜘蛛不抓取ab目錄下其他文件,而只抓取其中cd下的文件:
User-agent: *
Disallow: /ab/
Allow: /ab/cd
$通配符 - 匹配URL結(jié)尾的字符。如下面robots代碼將允許蜘蛛訪問以.htm為后綴的URL:
User-agent: *
Allow: .htm$
*通配符 - 告訴蜘蛛匹配任意一段字符。如下面一段robots代碼將禁止蜘蛛抓取所有htm文件:
User-agent: *
Disallow: /*.htm
Sitemaps位置 - 告訴蜘蛛你的網(wǎng)站地圖在哪里,格式為:
Sitemap:
三家都支持的Meta標(biāo)簽包括:
NOINDEX - 告訴蜘蛛不要索引某個(gè)網(wǎng)頁。
NOFOLLOW - 告訴蜘蛛不要跟蹤網(wǎng)頁上的鏈接。
NOSNIPPET - 告訴蜘蛛不要在搜索結(jié)果中顯示說明文字。
NOARCHIVE - 告訴蜘蛛不要顯示快照。
NOODP - 告訴蜘蛛不要使用開放目錄中的標(biāo)題和說明。
上面這些記錄或標(biāo)簽,現(xiàn)在三家都共同支持。其中通配符好像以前雅虎微軟并不支持。百度現(xiàn)在也支持Disallow,Allow及兩種通配符。Meta標(biāo)簽我沒有找到百度是否支持的官方說明。
只有Google支持的Meta標(biāo)簽有:
UNAVAILABLE_AFTER - 告訴蜘蛛網(wǎng)頁什么時(shí)候過期。在這個(gè)日期之后,不應(yīng)該再出現(xiàn)在搜索結(jié)果中。
NOIMAGEINDEX - 告訴蜘蛛不要索引頁面上的圖片。
NOTRANSLATE - 告訴蜘蛛不要翻譯頁面內(nèi)容。
雅虎還支持Meta標(biāo)簽:
Crawl-Delay - 允許蜘蛛延時(shí)抓取的頻率。
NOYDIR - 和NOODP標(biāo)簽相似,但是指雅虎目錄,而不是開放目錄。
Robots-nocontent - 告訴蜘蛛被標(biāo)注的部分html不是網(wǎng)頁內(nèi)容的一部分,或者換個(gè)角度,告訴蜘蛛哪些部分是頁面的主要內(nèi)容(想被檢索的內(nèi)容)。
MSN還支持Meta標(biāo)簽:
Crawl-Delay
另外提醒大家注意的是,robots.txt文件可以不存在,返回404錯(cuò)誤,意味著允許蜘蛛抓取所有內(nèi)容。但抓取robots.txt文件時(shí)卻發(fā)生超時(shí)之類的錯(cuò)誤,可能導(dǎo)致搜索引擎不收錄網(wǎng)站,因?yàn)橹┲氩恢纑obots.txt文件是否存在或者里面有什么內(nèi)容,這與確認(rèn)文件不存在是不一樣的。
網(wǎng)站名稱:robots的使用方法說明
標(biāo)題URL:http://www.rwnh.cn/news32/310882.html
成都網(wǎng)站建設(shè)公司_創(chuàng)新互聯(lián),為您提供響應(yīng)式網(wǎng)站、商城網(wǎng)站、云服務(wù)器、品牌網(wǎng)站建設(shè)、自適應(yīng)網(wǎng)站、虛擬主機(jī)
廣告
聲明:本網(wǎng)站發(fā)布的內(nèi)容(圖片、視頻和文字)以用戶投稿、用戶轉(zhuǎn)載內(nèi)容為主,如果涉及侵權(quán)請(qǐng)盡快告知,我們將會(huì)在第一時(shí)間刪除。文章觀點(diǎn)不代表本網(wǎng)站立場(chǎng),如需處理請(qǐng)聯(lián)系客服。電話:028-86922220;郵箱:631063699@qq.com。內(nèi)容未經(jīng)允許不得轉(zhuǎn)載,或轉(zhuǎn)載時(shí)需注明來源:
創(chuàng)新互聯(lián)