搜索
编程论坛
→
开发语言
→
『 Python论坛 』
→ {爬虫问题}网页数量不知,如何确定线程何时结束? 而且要保证爬完。
标题:
{爬虫问题}网页数量不知,如何确定线程何时结束? 而且要保证爬完。
只看楼主
pypro
等 级:
新手上路
帖 子:18
专家分:0
注 册:2010-4-10
结帖率:
80%
楼主
问题点数:0 回复次数:2
{爬虫问题}网页数量不知,如何确定线程何时结束? 而且要保证爬完。
{爬虫问题}网页数量不知,如何确定线程何时结束?
而且要保证爬完。
搜索更多相关主题的帖子:
线程
爬虫
结束
数量
网页
2010-04-15 16:08
外部三电铃
来 自:那一年
等 级:
贵宾
威 望:
55
帖 子:2004
专家分:7306
注 册:2007-12-17
第
2
楼
得分:0
多线程爬虫吧,每采集一个页面的时候在控制台用print输出一段内容,比如“正在采集XXX……”,这样采集的时候控制台会接连不断的输出内容。
如果超过5分钟不输出内容,基本上算是爬完了
那一年,苍井空还是处女
2010-04-15 20:01
pypro
等 级:
新手上路
帖 子:18
专家分:0
注 册:2010-4-10
第
3
楼
得分:0
回复 2楼 外部三电铃
每个线程任务设定的是从队列里取一个URL爬
由于不知道具体网页数量,队列里的结束标记也不好放
理论上应该可以设定一段时间内没有输出就结束线程
但是这个PYTHON能实现不?
2010-04-15 21:10
3
1/1页
1
参与讨论请移步原网站贴子:
https://bbs.bccn.net/thread-303122-1-1.html
关于我们
|
广告合作
|
编程中国
|
清除Cookies
|
TOP
|
手机版
编程中国
版权所有,并保留所有权利。
Powered by
Discuz
, Processed in 0.464530 second(s), 8 queries.
Copyright©2004-2024, BCCN.NET, All Rights Reserved