siting 发表于 2008-7-12 15:05:28

火车头采集软件的Bug,or采集规则设置错误?

大家还记得我前面写的给使用火车头采集的朋友们一个忠告一文吧,重新安装火车头采集软件后,我立即重写了女人是衣服网站的采集规则,结果又碰到一点小问题,不知是我的采集规则设置错误,还是火车头采集软件的Bug,如下图:
http://photo1.bababian.com/upload11/20080712/2650CD1966BA00D00042B3D86074E18D_500.jpg
看到了吧,修改火车头采集规则之前,我的女人是衣服网站所采集来的文章,都被自动添加了H2标签,导致整篇文章的字体都非常大,修改以后,采集的文字正常。
那么,我到底修改了哪些采集规则呢,如下图:
http://photo1.bababian.com/upload11/20080712/1CC8831DDCF296F0A90EE984A6C17173_500.jpg
自己写过采集规则的朋友一定看得出来,修改前后的采集规则没有本质的变动,应该不会产生给全文自动添加H2标签的问题,那么这就是我今天的疑问所在了:火车头为什么会自动给采集过来的文章添加多余的标签呢?
不知道这是我的采集规则设置错误,还是火车头采集软件的Bug的缘故。我猜想,会不会是火车头在采集的时候,对某些html标签的过滤和重组合不严格,造成了采集结果的混乱。希望论坛里面的牛X们多提意见^_^

[ 本帖最后由 siting 于 2008-7-12 17:40 编辑 ]

rq204 发表于 2008-8-2 10:26:38

规则

sushy 发表于 2008-8-3 08:50:41

估计是你自己网站的原因吧,建议你还是修改一下自己的网站代码。

据我了解,有些BLOG默认标题页是标题为H1,摘要为H2的
页: [1]
查看完整版本: 火车头采集软件的Bug,or采集规则设置错误?