eyering 发表于 2010-7-29 00:09:35

如何采集网页中注释部分中的链接呢?望高手提供思路

采集深度为2
查看列表页源代码,所需链接如下所示:

<!-- <a href="http://***.com" target="_blank" class=m>链接</a> //-->

eyering 发表于 2010-7-29 14:20:54

与不带注释的一样采集。。。。
Babbi 发表于 2010-7-29 08:23 http://bbs.locoy.com/images/common/back.gif

{:3_162:}采集不到吧,我试过很多次都不行。。。

eyering 发表于 2010-7-29 15:08:14

把网址贴出来看看。。。
Babbi 发表于 2010-7-29 14:29 http://bbs.locoy.com/images/common/back.gif
我简化一下:

这是起始页地址:
http://www.ovki.cn/start.html

点击进入列表页地址:
http://www.ovki.cn/locoy1.html
http://www.ovki.cn/locoy2.html
http://www.ovki.cn/locoy3.html

查看源码。
里面隐藏有目标内容页网址:
http://www.ovki.cn/link1.html
http://www.ovki.cn/link2.html
http://www.ovki.cn/link3.html

如何才能采集到上述link1,link2,link3网址?{:3_148:}

eyering 发表于 2010-7-29 16:17:45

设置:
结果:
Babbi 发表于 2010-7-29 16:00 http://bbs.locoy.com/images/common/back.gif


    非常感谢。

8过可能我没说清楚。
我的意思是 采集网址规则,而不是采集内容规则。

江湖小子 发表于 2010-7-29 16:46:40

也是可以的。。。

eyering 发表于 2010-7-29 19:07:31

本帖最后由 eyering 于 2010-7-29 19:09 编辑

很无奈。。。。你有仔细研究过吗?
Babbi 发表于 2010-7-29 17:37 http://bbs.locoy.com/images/common/back.gif


    有仔细研究,也尝试了很多次。但我采集到的是这样的结果。


网址提取规则为空,这样应该可以提取出所有网址。


我的是个人版。。。

wxl08 发表于 2010-7-30 09:40:05

这上面有些地方是要设置的。。。。
页: [1]
查看完整版本: 如何采集网页中注释部分中的链接呢?望高手提供思路