如果有谁被火车的"同时采集多页面"忽悠了,请看!
之前一直以为第一个规则 “依据对默认地址生成新地址....” 用正则,以为是抓取页面的某条地址来取数据,跟孤魂同学研究了一下正则,结果出来的地址跟原地址一样,好像一点反映都没有。还以为这个功能是白搭的。然后一直在研究这段帮助:
对于同时一个下载内容页和在新窗口打开的下载地址页这种情况的采集,
还有如一个电脑产品的参数,图片,商家,价格,评论等存在于不同的页面的情况均应在这里定义。
比如我们采集的主内容页面是:http://product.it168.com/detail/doc/158347/detail.shtml
而价格页是:http://product.it168.com/detail/doc/158347/price.shtml,图片页是:http://product.it168.com/detail/doc/158347/pic.shtml
定义一个价格页和图片页,相应的替换detail为price或pic即可,
最后在定义标签的时候选择采集采集的内容属于哪个页面
唉,结果发现可能是自己语文水平不好, 相应的替换detail为price或pic即可发现这一句才是关键。
例如原地址
http://data.movie.xunlei.com/movie/37814
但是迅雷的关于明晰的介绍其实在
http://movie.xunlei.com/movie/37814/****下面
其实规则就是
将 http://data.(.*)
替换成 http://$1/feature
测试一下
结果出来 http://movie.xunlei.com/movie/37814/]http://movie.xunlei.com/movie/37814/feature]http://movie.xunlei.com/movie/37814/feature
就这么简单,别想得太复杂了。:Q 问题的关键是很多朋友并不知道$1的这种用法,我前天花了两天时间终于在遨游广告过滤论坛中学到了这个$1 -$10,如果够强,可以设定10个变量一起跑,那才叫强大。 :ali0ls :ali0ls 实践出真知 但果如果是"在默认页源代理中获得地址"呢?
因为后面有不是一样的.
http://www.114dy.net/downinfo/5425.html介绍地址
http://www.114dy.net/ViewDownloadUrl.asp?ID=5425下载页面地址 如果要从这个页面
http://b2b.hc360.com/supplyself/42068543.html
得到下个页面要如何设置
http://lwpk.b2b.hc360.com/shop/show.html
这样
http://(.*)/supplyself/(.*).html
http://$1/shop/show.html
对吗?
回复 5楼 的帖子
两个地址在哪里有联系呢? 回五楼:其实是由这个地址
http://b2b.hc360.com/supplyself/42068543.html
得到
http://lwpk.b2b.hc360.com/
再在上面地址通过查看详细介绍...
得到
http://lwpk.b2b.hc360.com/shop/show.html
也就是多了一个中间地址
这样可以采集吗???
太多了吧,起点小说如何采呢
起点小说如何采呢
页:
[1]