作者Flying (花水木)
看板Blog
标题[教学] 如何掌控robots对自己网站的存取?
时间Sun Jul 8 09:47:52 2007
原文 :
http://hanamitsuki.com/blog-tech/robots-txt.htm
今天了解了一下这部分,因为网站这麽多东西,也许会有些东西是不想被搜寻到的,
比方说只是要暂时上传到空间、或是开一个目录拿来放现在正在进行测试的网站等等(我
接case时就会必须放到我的空间测试),又不能直接关掉权限,因为还是需要能够存取,
这种情况又不希望被登记到搜寻引擎里面弄乱我的网站索引。所以就需要用到robots.txt
这个档案。
其实Google在这部分说得满清楚了。以下我整理出一些要点。
1. robots.txt 必须存放在网域的根目录。
2. 语法:User-Agent 和 Disallow。意思就是「你不要谁(User-Agent)来存取哪些东
西(Disallow)?」
3. googlebot特有语法:Allow,让google某些bot搜寻刚刚你有Disallow过的特定资
料。
4. 使用「*」来代表一串任意字元
5. 使用「$」表示 URL 的结尾字元(副档名)
范例:
所有robots无法检索目录folder1
User-Agent:*
Disallow: /folder1/
所有robots无法检索目录folder1但可以检索里面的myfile.html
User-Agent:*
Disallow: /folder1/
Allow:/folder1/myfile.html
无法检索特定档案
User-Agent:*
Disallow: /private_file.html
无法检索特定档案类型
User-Agent:*
Disallow: /*.gif$
无法检索动态产生的网页
User-Agent:*
Disallow: /*?
只让google adsense检索某网页
User-Agent:*
Disallow:/folder1/
User-Agent:MediaPartners-Google
Allow:/folder1/
拦截所有以 private 开头之子目录的存取
User-Agent:Googlebot
Disallow:/private*/
常用User-Agent列表(Robots):
* Googlebot:Google 网页索引及新闻索引
* MediaPartners-Google:Google Adsense 索引网页以决定广告内容
* Googlebot-Mobile:Google手机网页索引
* Googlebot-Image:索引网站里的图片
* Adsbot-Google:索引广告主的广告网页来看品质如何
* Feedfetcher-Google:Google的Feed/RSS索引
* MSNBot:MSN 索引机器人
* del.icio.us-thumbnails:del.icio.us的网站缩略图撷图robot
* Yahoo-Blogs:Yahoo部落格索引
* Yahoo-MMAudVid:Yahoo多媒体档案索引
* YahooFeedSeeker:Yahoo的Feed/RSS索引
详细延伸阅读请见:
http://hanamitsuki.com/blog-tech/robots-txt.htm
--
※ 发信站: 批踢踢实业坊(ptt.cc)
◆ From: 116.59.122.137