tidyflow:一个数据清洗小工具
记录我为什么做 tidyflow,以及它目前刻意保持的小范围。
Python开源项目数据清洗
很多数据处理任务真正麻烦的地方不在分析,而在开始前。CSV 有重复行,Excel 混着空值,列名和文本字段又不规范。每次都临时拼脚本能解决,但很难复用。
tidyflow 是我为这些场景写的小工具。它把“先诊断,再清洗,最后生成报告”收进一条清楚的流程里,目标是让一份脏数据尽快进入可以继续分析的状态。
我没有把它做成大型数据平台。它只处理日常清洗里最常见的问题:重复值、缺失值、列名规范化、文本整理和质量报告。这个边界让命令行入口和 Python API 都能保持简单。
现在核心流程已经可用,后续还会补配置文件、更多清洗策略、发布流程和测试样例。具体模块边界和使用方式已经拆到知识库,避免这篇记录重复技术细节。