Anthropic 数据工作流中的数据探索 Skill,支持围绕 CSV、Excel、Parquet、JSON 等文件检查字段、日期范围、空值、重复及异常值,输出结构化的数据体检报告,并建议后续分析方向。本文仅介绍本地文件路线,不要求连接数据库。
同一订单重复出现、金额单位不一致、退款被当成负异常——这些小问题足以让一张漂亮图表讲错故事。Explore Data 适合在正式分析前先把底子摸清:一行代表什么,哪个字段是主键,哪些数据缺失,哪些业务口径还没有说明。

安装:先把前提配齐
本文的命令使用 Skills CLI,只安装指定名称,不一次装入整个仓库。需要 Node.js 22.20.0 或更高版本(当前 CLI 要求)、npm/npx、Git,以及已经可正常使用的 Agent。请先审阅仓库和脚本,再授权执行。
命令末尾的 -a claude-code codex 表示为这两种宿主安装;只用 Claude Code 就保留 -a claude-code,只用 Codex 就保留 -a codex。默认安装在当前项目,不加 -g;只有确实想全局使用时才考虑 -g。安装目录以命令实际输出为准。
- 按下方命令安装真实名称 explore-data。不要使用旧文章里的 data-exploration 名称;公开仓库当前目录已经不同。
- 把脱敏的 orders.csv 放到项目目录,保留原件。让 Agent 具备读取文件及运行计算工具的能力;Skill 本身不是计算引擎,也不会自动替你安装 Python。
- 本地 Python 路线可先确认 python –version,再按需要安装 pandas 与 openpyxl。读取 Parquet 时还可能需要 pyarrow。数据库/MCP 是另一条可选接入路线,本教程不配置。
npx skills add anthropics/knowledge-work-plugins --skill explore-data -a claude-code codex根据所选本地环境需要,可使用:
python -m pip install pandas openpyxl使用:从一个小任务开始
- 让 Agent 先解释每一行和主要字段的含义,确认订单号、日期、金额单位以及退款口径,再开始统计。
- 检查空值比例、重复主键、范围和类别写法,并列出少量问题行示例。不要上来就要求“自动清洗一切”。
- 把疑似异常交给业务确认,再决定是否生成清洗副本。分析完要求报告保留检查口径、受影响行数和后续建议,不能只给一个结论。
这段提示词,可以直接改着用
使用 explore-data 检查当前目录的 orders.csv。先识别每行含义和订单主键,再检查重复订单、缺失金额、负数、异常日期及地区字段写法不一致。输出字段概览、问题行示例和修复建议,不要删除或覆盖原数据。最后推荐3个可继续分析的业务问题,并标明哪些结论受数据质量影响。负数可能是退款,请先询问口径。
做到哪一步,才算真正跑通?
应该得到字段概览、数据质量问题表、证据样例和下一步分析建议。报告中的行数、空值数量最好能追溯到实际脚本或查询,而不是模型凭表格截图估计。
常见问题:无法读 .xlsx 时,检查本地计算环境及 openpyxl;无法读 Parquet 时检查 pyarrow。安装依赖应在自己的项目虚拟环境中进行。数据太大时先抽样分析结构,再按需要做全量计算;不要把整个大文件塞进聊天文本。
边界与费用:疑似异常不等于错误;负数可能是退款,重复订单行也可能是不同商品明细。连接数据库须另行配置并优先使用只读权限。涉及客户、交易和财务数据时,先确认宿主及模型的数据处理政策。

公开源码:https://github.com/anthropics/knowledge-work-plugins/tree/main/data/skills/explore-data
代码许可:Apache-2.0。许可覆盖范围以仓库 LICENSE 为准,第三方服务和素材另行遵守各自条款。







