Python 实现 Excel 与 Markdown 互转的实用指南

0 阅读4分钟

在数据分析和文档编写工作中,Excel 和 Markdown 是两种使用频率很高的格式。Excel 擅长存储和展示结构化数据,而 Markdown 凭借其简洁的语法,在技术文档、静态网站和 Git 驱动的协作流程中被广泛应用。当需要将电子表格数据复用到 Markdown 文档中时,手动复制粘贴不仅效率低下,还容易引入格式错误。使用 Python 实现自动化转换,是一种更可靠的方案。

环境准备

本文借助一个独立的 Python Excel 处理库来实现 Excel 与 Markdown 之间的转换。该库无需安装 Microsoft Office,可在多种 Python 环境中运行。从 PyPI 安装即可:

pip install spire.xls

Markdown 转换功能从 16.4.0 版本开始提供支持。如果安装了更早的版本,需要执行升级:

pip install --upgrade spire.xls

Excel 转 Markdown 的基础用法

将 Excel 文件转换为 Markdown 的核心逻辑非常简洁:创建工作簿对象,加载 Excel 文件,然后将其保存为 Markdown 格式。

from spire.xls import Workbook

# 创建 Workbook 对象
workbook = Workbook()

# 加载 Excel 文件
workbook.LoadFromFile("数据报表.xlsx")

# 保存为 Markdown 文件
workbook.SaveToMarkdown("输出报表.md")

# 释放资源
workbook.Dispose()

执行这段代码后,Excel 中的表格数据会被转换为 Markdown 格式的表格,并保存到指定的 .md 文件中。

指定导出范围

有时候并不需要转换整个工作簿,而只需要导出某个特定的工作表或者单元格区域。

转换特定工作表

如果工作簿包含多个工作表,可以通过 Worksheets 集合获取指定工作表:

from spire.xls import Workbook

workbook = Workbook()
workbook.LoadFromFile("月度数据.xlsx")

# 通过名称获取指定工作表(示例:遍历查找名为 "Sheet1" 的工作表)
target_sheet_name = "Sheet1"
sheet = None
for ws in workbook.Worksheets:
    if ws.Name == target_sheet_name:
        sheet = ws
        break

if sheet is not None:
    # 创建一个新的工作簿,将目标工作表复制进去,然后保存为 Markdown
    new_workbook = Workbook()
    new_workbook.CreateEmptySheets(1)
    new_sheet = new_workbook.Worksheets[0]
    # 复制源工作表的全部内容
    sheet.AllocatedRange.Copy(new_sheet.Range[1, 1], CopyRangeOptions.All)
    new_workbook.SaveToMarkdown("月度报表.md")
    new_workbook.Dispose()

workbook.Dispose()

转换指定单元格区域

如果只想导出 Excel 文件中的某一部分数据,比如一个特定的数据区域(例如 A1:F20),可以创建一个新的工作簿并将该区域复制过去:

from spire.xls import Workbook, CopyRangeOptions

workbook = Workbook()
workbook.LoadFromFile("项目数据.xlsx")

# 获取第一个工作表
sheet = workbook.Worksheets[0]

# 指定需要导出的单元格区域,例如 A1 到 F20
src_range = sheet.Range["A1:F20"]

# 创建一个新的工作簿,用于存放导出的区域
new_workbook = Workbook()
new_workbook.CreateEmptySheets(1)
new_sheet = new_workbook.Worksheets[0]

# 定义目标区域(大小与源区域一致)
dest_range = new_sheet.Range[1, 1, src_range.Rows.Count, src_range.Columns.Count]

# 将源区域复制到新工作簿
src_range.Copy(dest_range, CopyRangeOptions.All)

# 保存为 Markdown
new_workbook.SaveToMarkdown("项目摘要.md")

new_workbook.Dispose()
workbook.Dispose()

自定义转换选项

该库提供了 MarkdownOptions 类,用于控制转换过程中图片路径和超链接的保存方式。

  • SavePicInRelativePath:控制图片是否使用相对路径。设为 True 时,图片路径为相对路径(如 ![Image](pic1.png));设为 False 时,使用绝对路径。
  • SaveHyperlinkAsRef:控制超链接的格式。设为 True 时,超链接以引用风格保存(如 [Link Text][ref1]);设为 False 时,以内联风格保存(如 [Link Text](https://example.com))。
from spire.xls import Workbook, MarkdownOptions

workbook = Workbook()
workbook.LoadFromFile("report.xlsx")

markdown_options = MarkdownOptions()
# 使用相对路径保存图片
markdown_options.SavePicInRelativePath = True
# 使用内联链接保存超链接
markdown_options.SaveHyperlinkAsRef = False

workbook.SaveToMarkdown("custom_output.md", markdown_options)
workbook.Dispose()

其他可选的转换方式

除了上述使用的 Excel 处理库,社区中还有一些其他工具可以实现类似的功能。

xl2md 是一个轻量级的命令行工具,可以将 Excel 工作簿中的每个工作表转换为独立的 Markdown 文件:

# 安装
pip install xl2md

# 基本使用:将整个工作簿的每个工作表转为单独的 .md 文件
xl2md 数据文件.xlsx

# 指定输出目录
xl2md 数据文件.xlsx --out-dir "markdown_output"

MarkItDown 是微软开源的文档转换工具,支持将 Excel、PDF、Word 等多种格式转换为 Markdown,适用于文本分析和 LLM 处理流程:

from markitdown import MarkItDown

md = MarkItDown()
result = md.convert("数据文件.xlsx")
print(result.text_content)

开发者可以根据具体的使用场景(如是否需要批量处理、是否需要保留特定格式等)选择最合适的工具。

小结

使用 Python 将 Excel 转换为 Markdown,可以显著提高数据处理和文档编写的效率。通过本文介绍的 Excel 处理库,开发者可以在代码中灵活控制转换的粒度——无论是整个工作簿、单个工作表,还是特定的单元格区域。结合 MarkdownOptions 提供的自定义选项,能够满足大部分日常转换需求。除了上述方案,社区中也有其他开源工具可供选择,适用于不同的工作流偏好。