提取文本
docx只支持docx格式,所以如果想读取doc需要另存为docx格式即可文章来源:https://www.toymoban.com/news/detail-698334.html
import docx # pip3 install python-docx
doc = docx.Document('three.docx') for paragraph in doc.paragraphs: print(paragraph.text)
提取图片文章来源地址https://www.toymoban.com/news/detail-698334.html
import zipfile import os, re
# docx本质上也是个压缩文件,使用zip我们就可以看到所有图片都被保存到了word/media里边 # 我们将该文件夹下的数据获取即可 with zipfile.ZipFile('one.zip', 'r') as zip_ref: for name in zip_ref.namelist(): if len(re.findall(r'^word/media/', name)) > 0: zip_ref.extract(name, '')
到了这里,关于python提取word文本和word图片的文章就介绍完了。如果您还想了解更多内容,请在右上角搜索TOY模板网以前的文章或继续浏览下面的相关文章,希望大家以后多多支持TOY模板网!