网页抓取

十月 05, 2023

此條目没有列出任何参考或来源。 (2016年3月15日)
維基百科所有的內容都應該可供查證。请协助補充可靠来源以改善这篇条目。无法查证的內容可能會因為異議提出而被移除。

网页抓取（英語：web scraping）是一种从网页上获取页面内容的计算机软件技术。通常透過软件使用低级别的超文本传输协议模仿人类的正常访问。

网页抓取和网页索引极其相似，其中网页索引指的是大多数搜索引擎采用使用的机器人或网络爬虫等技术。与此相反，网页抓取更侧重于转换网络上非结构化数据（常见的是HTML格式）成为能在一个中央数据库和电子表格中储存和分析的结构化数据。网页抓取也涉及到网络自动化，它利用计算机软件模拟了人的浏览。网页抓取的用途包括在线的价格比较，联系人抓取，气象数据监测，网页变化检测，科研，混搭和Web数据集成。

技术层面编辑

网络抓取用于自动化获取万维网上的信息

人工复制与粘贴：最好的网页抓取技术也比不上人类的手工复制与粘贴，尤其是在某些网站采取技术手段禁止自动化网页抓取的情况下，人工的复制与粘贴就成了唯一的解决方案。

文本搜索与正则表达式：文本搜索并且配合正则表达式可以有效的从页面上提取需要的内容。在基于UNIX的系统上可以使用grep，在其他平台或其他编程语言（例如Perl，Python）中也有相应的命令或语法。

基于HTTP编程：无论是静态网页还是动态网页均可以通过发送HTTP请求给服务器来获得，所以可以通过直接进行socket编程来实现。

HTML语法分析器：很多网站都是使用数据库来存储他们的数据，用户访问的时候再通过程序自动按照指定的格式生成，由于生成的这些网页都采用了相同的的格式或者模板等，所以可以通过对获取到的HTML页面使用语法分析器进行语法分析，然后就可以使用HTML标签来提取需要的内容。使用HTML语法分析器同文本搜索与正则表达式相比较程序更加的健壮，也免于构造复杂的正则表达式。

著名工具编辑

Apache Camel
archive.is
Automation Anywhere
Convertigo
cURL
Data Toolbar
Diffbot
Firebug
Greasemonkey
Heritrix
HtmlUnit
HTTrack
iMacros
Import.io
Jaxer
Node.js
nokogiri
PhantomJS
ScraperWiki
Scrapy
Selenium
SimpleTest
UiPath
watir
Wget
Wireshark
WSO2 Mashup Server
Yahoo! Query Language (YQL)

参见编辑

网络爬虫

十月 05, 2023

网页抓取, 此條目没有列出任何参考或来源, 2016年3月15日, 維基百科所有的內容都應該可供查證, 请协助補充可靠来源以改善这篇条目, 无法查证的內容可能會因為異議提出而被移除, 英語, scraping, 是一种从网页上获取页面内容的计算机软件技术, 通常透過软件使用低级别的超文本传输协议模仿人类的正常访问, 和网页索引极其相似, 其中网页索引指的是大多数搜索引擎采用使用的机器人或网络爬虫等技术, 与此相反, 更侧重于转换网络上非结构化数据, 常见的是html格式, 成为能在一个中央数据库和电子表格中储存和分. 此條目没有列出任何参考或来源 2016年3月15日維基百科所有的內容都應該可供查證请协助補充可靠来源以改善这篇条目无法查证的內容可能會因為異議提出而被移除网页抓取英語 web scraping 是一种从网页上获取页面内容的计算机软件技术通常透過软件使用低级别的超文本传输协议模仿人类的正常访问网页抓取和网页索引极其相似其中网页索引指的是大多数搜索引擎采用使用的机器人或网络爬虫等技术与此相反网页抓取更侧重于转换网络上非结构化数据常见的是HTML格式成为能在一个中央数据库和电子表格中储存和分析的结构化数据网页抓取也涉及到网络自动化它利用计算机软件模拟了人的浏览网页抓取的用途包括在线的价格比较联系人抓取气象数据监测网页变化检测科研混搭和Web数据集成技术层面编辑网络抓取用于自动化获取万维网上的信息人工复制与粘贴最好的网页抓取技术也比不上人类的手工复制与粘贴尤其是在某些网站采取技术手段禁止自动化网页抓取的情况下人工的复制与粘贴就成了唯一的解决方案文本搜索与正则表达式文本搜索并且配合正则表达式可以有效的从页面上提取需要的内容在基于UNIX的系统上可以使用grep 在其他平台或其他编程语言例如Perl Python 中也有相应的命令或语法基于HTTP编程无论是静态网页还是动态网页均可以通过发送HTTP请求给服务器来获得所以可以通过直接进行socket编程来实现 HTML语法分析器很多网站都是使用数据库来存储他们的数据用户访问的时候再通过程序自动按照指定的格式生成由于生成的这些网页都采用了相同的的格式或者模板等所以可以通过对获取到的HTML页面使用语法分析器进行语法分析然后就可以使用HTML标签来提取需要的内容使用HTML语法分析器同文本搜索与正则表达式相比较程序更加的健壮也免于构造复杂的正则表达式著名工具编辑Apache Camel archive is Automation Anywhere Convertigo cURL Data Toolbar Diffbot Firebug Greasemonkey Heritrix HtmlUnit HTTrack iMacros Import io Jaxer Node js nokogiri PhantomJS ScraperWiki Scrapy Selenium SimpleTest UiPath watir Wget Wireshark WSO2 Mashup Server Yahoo Query Language YQL 参见编辑网络爬虫取自 https zh wikipedia org w index php title 网页抓取 amp oldid 71980511, 维基百科，wiki，书籍，书籍，图书馆，

文章

，阅读，下载，免费，免费下载，mp3，视频，mp4，3gp， jpg，jpeg，gif，png，图片，音乐，歌曲，电影，书籍，游戏，游戏。