数据提取

Posted 在这里, 意淫和实干都值得尊重

tags:

篇首语:本文由小常识网(cha138.com)小编为大家整理,主要介绍了数据提取相关的知识,希望对你有一定的参考价值。

页面解析和数据提取

一般来讲对我们而言,需要抓取的是某个网站或者某个应用的内容,提取有用的价值。内容一般分为两部分,非结构化的数据 和 结构化的数据。

  • 非结构化数据:先有数据,再有结构,
  • 结构化数据:先有结构、再有数据
  • 不同类型的数据,我们需要采用不同的方式来处理。

非结构化的数据处理

文本、电话号码、邮箱地址
  • 正则表达式
html 文件
  • 正则表达式
  • XPath
  • CSS选择器

结构化的数据处理

JSON 文件
  • JSON Path
  • 转化成Python类型进行操作(json类)
XML 文件
  • 转化成Python类型(xmltodict)
  • XPath
  • CSS选择器
  • 正则表达式

侵权删:

  笔记来自传智播客课件, 感谢传智.

以上是关于数据提取的主要内容,如果未能解决你的问题,请参考以下文章

如何用R语言在数据中提取指定列数据,并且形成一个新的数据表

在JAVA中如何从集合中提取数据

VB 网页数据提取

用Vb提取网页中的数据

vb中提取网页中的数据

如何提取出cell中具体数据 matlab