2026-07-05 / 5 min

tidyflow 的 CLI 与 Python API 用法

CLI 用于直接处理文件;链式 Python API 用于脚本、notebook 和需要复用的清洗流程。

PythonCLI数据清洗

两种入口

tidyflow 提供 CLI 和 Python API 两个入口,适用场景不同。

CLI 用于直接处理一个 CSV、Excel 或 JSON 文件,适合在分析前先完成一次清洗。

Python API 用于脚本、notebook 和后续数据管线,适合把同一组清洗步骤写进代码后反复调用。

CLI 用法

下面的命令清洗 data.csv,把结果写入 cleaned.csv,并生成报告:

tidyflow clean data.csv -o cleaned.csv --report

只检查问题、不改动数据时,运行:

tidyflow detect data.csv

查看文件基本信息时,运行:

tidyflow info data.csv

CLI 负责解析参数、调用核心模块、展示结果和处理错误。具体清洗规则留在核心模块,避免命令函数同时承担规则实现。

Python API 用法

链式 API 按实际执行顺序书写清洗步骤:

from tidyflow import Cleaner

result = (
    Cleaner("data.csv")
    .remove_duplicates()
    .fill_missing(strategy="mean")
    .to_snake_case()
    .strip_text()
    .clean()
)

result.save("cleaned.csv")
result.report("report.md")

使用时需要区分 CleanerCleanResult

Cleaner 保存当前清洗状态和操作链。CleanResult 提供结果输出,例如保存文件、生成报告或导出对比图。

诊断和清洗分开

诊断器保持只读,只报告发现的问题:

  • warning:少量缺失值、轻微格式问题。
  • error:缺失比例较高、类型混乱。
  • critical:大面积空列或无法继续分析的问题。

先诊断、再清洗,用户能确认问题类型和处理范围;诊断过程本身不会改变原始数据。

配置化方向

常用规则可以写进配置文件:

deduplicate = true
fill_strategy = "median"
snake_case = true
strip_text = true

读取这份配置后,同一套规则可以应用到多个文件,减少重复输入命令参数。