能力有限无奈用求救 ~ 火车的 2 个问题
本人以前用其他采集 由于手动量大所以再次选择火车
前几个网站都能够顺利采集
但是后面就出问题了
比如这个列表页面http://www.44xp.com/html/zp/ (特别提醒:页面有流氓插件,请开杀毒软件)
采集到的文章列表是这样的。如图:
出现的是网此重复
于是打开代码查看结构 结果如下:
<a href="/html/zp/2007/4-10/90701284.html" title="洋妞跳扇子舞,跳著跳著衣服跳沒了" target=_blank>洋妞跳扇子舞,跳著跳著衣服跳沒了</a></td>
使用的是<a href="/html/zp/2007/4-10/90701284.html根据火车提供的自定义连接 但是弄了半天没弄好以失败告终
望高手指点
问题二:
在需要登陆的论坛采集失败。无论是用火车的登陆器登陆 还是用专门的 COOKIES 抓取软件 获得
但是都出现 采集器不访问,根本不连接网站了。
望有经验的朋友指点一下
[ 本帖最后由 chinalini 于 2007-4-11 13:26 编辑 ] 这样的问题 怎么没人解释一下哦 火车斑竹些 问题一:采集全部网址,导出二级网址,将html/zp/\"/html替换为html
问题二:可能是网站有防采的功能,建议放弃。 导出二级节点,用记事本编辑一下吧
第二个问题,我想很多人都碰到过,应该就是cookie的问题,到不象防采的问题。
例如这个网站要是有多个论坛放在一个数据库里,cookie就和默认的不一样,取下来也不一定能登录上,我碰到过多次,这样的,一贴在火车里面就提示我cookie有问题,没办法
页:
[1]