关于我们

策法律师网隶属于上海市华荣律师事务所 ,律所成立于1996年, 拥有近200人的律师团队,各领域均有专家级律师坐镇 ,平均执业年限在5年以上 ,70%以上律师获得法律硕士学位。24年来,秉承专业化、规模化、品牌化、国际化的发展理念,为数以万计的客户提供了优质的服务,解决各类疑难纠纷案件上万起,其中不乏重大案件,在业界赢得了良好的声誉和客户的信赖。 获得优秀律师事务所、司法系统先进集体等多项荣誉称号...

律师团队

律师团队

律师团队

律师办案

律师办案

案件研讨

案件研讨

热点关注

主页 > 其他纠纷 > 热点关注 >

有人用网络爬虫脚本没有经过别人同意多次偷窃

时间:2021-03-04 11:33 点击:    上海金牌刑事律师

网络爬虫是一个自动提取网页的程序,它为搜索引擎从万维网上下载网页,是搜索引擎的重要组成。传统爬虫从一个或若干初始网页的URL开始,获得初始网页上的URL,在抓取网页的过程中,不断从当前页面上抽取新的URL放入队列,直到满足系统的一定停止条件。聚焦爬虫的工作流程较为复杂,需要根据一定的网页分析算法过滤与主题无关的链接,保留有用的链接并将其放入等待抓取的URL队列。然后,它将根据一定的搜索策略从队列中选择下一步要抓取的网页URL,并重复上述过程,直到达到系统的某一条件时停止。另外,所有被爬虫抓取的网页将会被系统存贮,进行一定的分析、过滤,并建立索引,以便之后的查询和检索;对于聚焦爬虫来说,这一过程所得到的分析结果还可能对以后的抓取过程给出反馈和指导。

相对于通用网络爬虫,聚焦爬虫还需要解决三个主要问题:

(1) 对抓取目标的描述或定义;

(2) 对网页或数据的分析与过滤;

(3) 对URL的搜索策略。