什么是robots协定?
& A; i" \! H, c( Y$ N& B- a
: B. a+ M1 T! [ robots协定就是搜刮引擎的爬虫协定,它的呈现就是为了告知搜刮引擎该网站中哪些页面不成以爬取而天生的协定.robots协定是可以用任何文本编纂器编纂的协定.! H; p% ?( L; u8 t, Z/ w
, T3 v5 Y P0 D5 I. P3 k9 I
( o& j1 D; D! ]$ j5 _# I# b' c4 M# K: Z6 ?9 h
; w& E/ s3 ~( i! C
协定的写法:
% h# ]8 ^- ?2 x
7 `3 \4 [/ O) |) o+ ? User-agent: * 这里的*代表的所有的搜刮引擎种类,*是一个通配符
6 C& X9 _/ \& {0 O! Y! q5 i
+ m) J- I, K" k( ]$ P8 t Z* U Disallow: /admin/ 这里界说是制止爬寻admin目次下面的目次) I/ a% h/ M- F
% \6 q6 e6 y- n3 c
Disallow: /require/ 这里界说是制止爬寻require目次下面的目次
/ k/ N9 `/ [, N2 J8 [: B+ m0 k7 C/ n. M# z2 c6 H6 K; Y
Disallow: /ABC/ 这里界说是制止爬寻ABC目次下面的目次1 u3 j3 ?, k+ e7 ]1 H( ]6 r# Y
* n0 _9 d; e! z! E+ W
Disallow: /cgi-bin/*.htm 制止拜访/cgi-bin/目次下的所有以".htm"为后缀的URL(包括子目次).7 L2 b4 I/ t% b$ g2 f3 A5 q% [/ e
r7 Y$ W% u( A; c* j+ I5 `. K Disallow: /*?* 制止拜访网站中所有包括问号 (?) 的网址
$ c# ? i) c/ @! U/ U( z9 h
* k; f# t' F3 q7 X- b Disallow: /.jpg$ 制止抓取网页所有的.jpg格局的图片
# b# q+ w5 G% Y s, ^9 c- }
' {4 x% g% A2 Z. J Disallow:/ab/adc.html 制止爬取ab文件夹下面的adc.html文件.
/ A3 m4 H, ]" T7 Z! g. O. n* z9 x/ [6 M
Allow: /cgi-bin/ 这里界说是答应爬寻cgi-bin目次下面的目次
& C: [! x3 S# D% ^# r0 l9 c6 H+ Z" v" B1 M3 _6 w0 f r
Allow: /tmp 这里界说是答应爬寻tmp的┞符个目次' v; V+ A6 b3 S" S3 W
- i! o7 S* O. ^' \' l/ o( P$ j
Allow: .htm$ 仅答应拜访以".htm"为后缀的URL.) m" l4 {% O: j' |( `5 `; J+ u& _9 u9 ^
) w0 I' A( P$ ?) T) ?* A
Allow: .gif$ 答应抓取网页和gif格局图片' N1 c6 R8 A6 V
8 X! M& k# q1 x; p$ N& { Sitemap: 网站舆图 告知爬虫这个页面是网站舆图
* G) i; m5 k6 b6 m6 H4 f. M8 j: d ?" j' |7 U0 g- R# r+ y0 b
( `/ i" M9 c: s9 F3 E1 s |
|