topscan 发表于 2008-2-18 11:46:12

如果有谁被火车的"同时采集多页面"忽悠了,请看!

之前一直以为第一个规则 “依据对默认地址生成新地址....” 用正则,以为是抓取页面的某条地址来取数据,跟孤魂同学研究了一下正则,结果出来的地址跟原地址一样,好像一点反映都没有。还以为这个功能是白搭的。

然后一直在研究这段帮助:
对于同时一个下载内容页和在新窗口打开的下载地址页这种情况的采集,
还有如一个电脑产品的参数,图片,商家,价格,评论等存在于不同的页面的情况均应在这里定义。
比如我们采集的主内容页面是:http://product.it168.com/detail/doc/158347/detail.shtml
而价格页是:http://product.it168.com/detail/doc/158347/price.shtml,图片页是:http://product.it168.com/detail/doc/158347/pic.shtml
定义一个价格页和图片页,相应的替换detail为price或pic即可,
最后在定义标签的时候选择采集采集的内容属于哪个页面

唉,结果发现可能是自己语文水平不好, 相应的替换detail为price或pic即可发现这一句才是关键。

例如原地址
http://data.movie.xunlei.com/movie/37814
但是迅雷的关于明晰的介绍其实在
http://movie.xunlei.com/movie/37814/****下面

其实规则就是
将 http://data.(.*)
替换成 http://$1/feature

测试一下
结果出来 http://movie.xunlei.com/movie/37814/]http://movie.xunlei.com/movie/37814/feature]http://movie.xunlei.com/movie/37814/feature
就这么简单,别想得太复杂了。:Q

sushy 发表于 2008-2-19 15:20:38

问题的关键是很多朋友并不知道$1的这种用法,我前天花了两天时间终于在遨游广告过滤论坛中学到了这个$1 -$10,如果够强,可以设定10个变量一起跑,那才叫强大。

沦陷今生 发表于 2008-2-19 15:22:44

:ali0ls :ali0ls 实践出真知

52computer 发表于 2008-7-13 08:37:04

但果如果是"在默认页源代理中获得地址"呢?

因为后面有不是一样的.

http://www.114dy.net/downinfo/5425.html介绍地址

http://www.114dy.net/ViewDownloadUrl.asp?ID=5425下载页面地址

september 发表于 2008-7-16 14:11:02

如果要从这个页面

http://b2b.hc360.com/supplyself/42068543.html

得到下个页面要如何设置

http://lwpk.b2b.hc360.com/shop/show.html


这样
http://(.*)/supplyself/(.*).html
http://$1/shop/show.html

对吗?

rq204 发表于 2008-7-16 16:14:20

回复 5楼 的帖子

两个地址在哪里有联系呢?

september 发表于 2008-7-16 17:54:19

回五楼:

其实是由这个地址
http://b2b.hc360.com/supplyself/42068543.html

得到

http://lwpk.b2b.hc360.com/   


再在上面地址通过查看详细介绍...


得到

http://lwpk.b2b.hc360.com/shop/show.html


也就是多了一个中间地址



这样可以采集吗???

xiaozhang 发表于 2008-7-16 18:53:02

太多了吧,起点小说如何采呢

起点小说如何采呢
页: [1]
查看完整版本: 如果有谁被火车的"同时采集多页面"忽悠了,请看!