tidyflow:一个 CSV / Excel / JSON 数据清洗小工具
把重复值、空值、列名整理和质量报告收进同一条流程里,省掉每次拿到脏数据时重新拼脚本的麻烦。
Python开源项目数据清洗
为什么做 tidyflow
很多数据处理本身并不难,麻烦常常出在开始前。CSV 里有重复行,Excel 混着空值,列名带空格和大小写,文本字段前后还藏着看不见的空白。真正开始分析前,总得先把这堆小问题收拾掉。
tidyflow 是我为这类场景写的小工具。它的目标很小:拿到一份脏数据后,先用一条清楚的流程把它整理到能继续分析的状态。
它解决的是启动成本
我希望它做的,是把“开始清洗数据”这一步变得没那么折腾。
一次性脚本当然能完成这些工作,不过脚本容易散在不同文件里,下次碰到相似问题又要重新拼一遍。tidyflow 把常见动作收进固定入口:先诊断,再清洗,最后生成报告。
我希望它保持的小边界
tidyflow 不需要长成大型数据平台。它把一件小事做好就够了:把脏数据整理成可以继续分析的数据。
这也决定了它的取舍。命令行入口要清楚,Python API 要顺手,报告要能说明清洗前后发生了什么。具体命令、链式 API 和模块划分,我会放到知识库里单独维护。
下一步
下一步我想补配置能力。比如把一套清洗规则写进 tidyflow.toml,这样就不用每次在命令行里重新写一遍,清洗流程也更容易复用。
这个方向如果打磨顺了,它会是个能放进日常工作里的小工具,而不只是项目列表里的 demo。