一种Web结构化数据快速提取方法及系统[发明专利]

专利名称:一种Web结构化数据快速提取方法及系统专利类型:发明专利
发明人:刘芳作,陈薇,王腾蛟,李强,邱镇,崔迎宝
申请号:CN201910021939.9
申请日:20190110
公开号:CN109948018A
公开日:
20190628
专利内容由知识产权出版社提供
摘要:本发明是一种Web结构化数据快速提取方法,步骤包括:层次遍历目标网站页面当中的网址链接,并以列表形式记录所有网站的网址和对应的网址跳转顺序;从上述列表中识别目标网页的网址,并记录对应的网址跳转顺序,按目标网站到目标网页访问的先后顺序进行网址拼接,生成访问目标网页的网址跳转顺序;根据贪心随机自适应搜索算法出访问目标网页的最优网址跳转顺序;根据上述最优网址跳转顺序访问目标网页,层次遍历目标页面的所有数据项标签,到所有目标数据项标签;从上述所有目标数据项标签中出最短标签路径;根据上述最优网址跳转顺序和最短路径爬取目标网页的目标数据。本发明还提供一种Web结构化数据快速提取系统。
申请人:北京大学,国网信息通信产业集团有限公司,国家电网有限公司,国网浙江省电力有限:100871 北京市海淀区颐和园路5号北京大学
国籍:CN
代理机构:北京君尚知识产权代理事务所(普通合伙)
代理人:余长江

本文发布于:2024-09-20 23:42:02,感谢您对本站的认可!

本文链接:https://www.17tex.com/tex/3/418969.html

版权声明:本站内容均来自互联网,仅供演示用,请勿用于商业和其他非法用途。如果侵犯了您的权益请与我们联系,我们将在24小时内删除。

标签:目标   网址   网页   有限公司   顺序
留言与评论(共有 0 条评论)
   
验证码:
Copyright ©2019-2024 Comsenz Inc.Powered by © 易纺专利技术学习网 豫ICP备2022007602号 豫公网安备41160202000603 站长QQ:729038198 关于我们 投诉建议