2008-01-01

工作杂记

今天接到一个任务,实现一个Spider,来方便团队的资讯和内容编辑人员,提高团队的开发效率.说实话,这个东西经常看见别人提起,但是实际动手发现一个问题是,简单的功能好做但是普遍的适应性就很差:比如可以在Sina体育版的新闻实现我的需求可是在时政版就不行-_-!

还有一些专题带了Video的,这个就得做一大堆的条件预判断,OMG,网易和Sohu偶还没有考虑呢!

不过我也发现Google的爬虫也是Python的,呵呵,貌似做的好的爬虫至少需要考虑

1.频繁的小文件读取

2.网站的普遍适应性(采集的命中率)

3.高可靠性

暂时就这么多了,经过昨天12小时的coding大概除了一个单页面的alpha版本,效率还有待提高啊:)

Technorati 标签: ,
评论
Jarymin 2008-01-18
确实很难做到通用,不过我的想法是做成独立的API然后调用
imjl 2008-01-18
通用难哦。
发表评论

提醒: 该博客已发表在公共论坛,博客所有留言会成为论坛回贴,留言请注意遵守论坛发贴规则

您还没有登录,请登录后发表评论

Jarymin
搜索本博客
存档
最新评论