添加链接
link之家
链接快照平台
  • 输入网页链接,自动生成快照
  • 标签化管理网页链接
相关文章推荐
欢乐的黄豆  ·  React Native 之读取JSON ...·  7 月前    · 
飞奔的企鹅  ·  null value in python ...·  8 月前    · 
重情义的刺猬  ·  python实现模糊查询 ...·  11 月前    · 
魁梧的咖啡豆  ·  从此爱上SQL ...·  1 年前    · 
首发于 程序员之家

使用python读取word文件里的表格信息

【小宅按】 在企查查查询企业信息的时候,得到了一些word文件,里面有些控股企业的数据放在表格里,需要我们将其提取出来。

word文件看起来很复杂,不方便进行结构化。实际上,一个word文档中大概有这么几种类型的内容:paragraph(段落),table(表格),character(字符)。笔者现在要解析的word文档中,基本都是段落和表格,本文主要来讲一下如何从word中解析出表格,并将表格信息进行结构化。

要想使用python解析word文件,我们可以使用包 docx ,首先我们需要安装它。

安装完成后,我们需要读取word文件,代码大致如下:

上面的代码中,tables已经是word文件中所有的table构成的list,我们要寻找的表格2.6是word文件中的第9个table,可以这样读取。

这里已经将表2.6的每一列每一行遍历啦,之后可以将抽取出来的4个参数写到CSV或插入数据库中。

更多精彩内容,请滑至顶部点击右上角关注小宅哦~


来源: 华为云社区 作者:开飞机的大象

编辑于 2019-07-10 14:22

文章被以下专栏收录

    程序员之家

    程序员之家

    欢迎投稿、交流