嵌套的网址列表怎么采集回来呢?
范例说明:比如此列表地址:
http://bbs.eachnet.com/forum_200000020_0_0_0_279.html
可以很轻易的获取其中的列表地址
问题的关键在于,实际上要采集的地址,在每篇文章中他又使用script 给隐藏起来了
比如:
<script src=http://mirror.community.eachnet.com/readcache_200000020_1200385291,1200385418,1200385422,1200385558,1200385559,1200386792,1200386812,1200386819,1200386854,1200386860_12082688266.html></script>
这样就又需要提取 script 中间嵌入的地址才能够采集
理论上是完全可以采集到的,但是怎样设置呢?
谢谢! 使用多页合并的功能 能不能说明白一些啊?貌似听不太懂。。。 多页采集
<!-- Forum_info 结束 -->(*)<script src=
></script>(*)<!-- Subject 开始 -->
[ 本帖最后由 fireye 于 2008-4-18 16:25 编辑 ] 谢谢 色色
色色为人忠厚,回答问题非常负责任
建议老大们为色色多加一些车厢! :ali1ls :ali1ls :ali1ls :ali1ls :ali1ls 此文需要更多的朋友看到
页:
[1]