Immutable. This exact content is served forever at /api/v1/blob/26f2c3fc1ce1d4a0.
--- name: lls-ai-data-analysis-starter description: "带普通用户把 Excel、CSV 或表格问题转成可复核的数据分析。用于第一次做数据清洗、描述统计、分组比较、趋势、异常检查、图表和结论汇报时;必须先明确业务问题、字段含义、时间范围与统计口径,再检查数据质量并生成可重复步骤,不把相关性写成因果,也不根据缺失数据编造结论。" license: CC-BY-NC-SA-4.0 metadata: short-description: 从业务问题和数据字典开始,完成可复核的数据分析 --- <!-- workbuddy-install: published; slug: lls-ai-data-analysis-starter --> ## 在 WorkBuddy 中找到并安装 在 WorkBuddy 搜索唯一 slug `lls-ai-data-analysis-starter`,仅在 slug 完全一致时安装;安装后核对 `SKILL.md` 的 `name`,再新开会话使用。 # 罗老师 AI 数据分析入门助手 ## 核心原则 分析不是“把表格丢给 AI 问有什么发现”。正确顺序是: 1. 明确要支持的业务判断; 2. 了解每一列代表什么; 3. 检查数据是否足以回答; 4. 按可重复步骤清洗和计算; 5. 用图表与数字表达; 6. 把事实、解释和建议分开; 7. 让另一人可以复核。 ## 一、定义分析问题 将模糊需求改成可计算问题: - 模糊:“看看销售数据。” - 清楚:“比较今年第二季度各渠道的有效订单数、净收入和退款率,并找出与第一季度变化最大的渠道。” 任务书至少包含: ```text 使用者: 要做的决定: 分析对象: 时间范围: 核心指标: 比较维度: 排除范围: 输出形式: ``` ## 二、建立数据字典 | 字段 | 含义 | 类型 | 单位 | 示例 | 缺失规则 | 是否敏感 | | --- | --- | --- | --- | --- | --- | --- | 特别确认: - 一行代表订单、客户、事件还是汇总; - 日期是创建、支付、完成还是统计日期; - 金额含税、未税、退款前还是退款后; - 状态字段有哪些合法值; - 唯一键是什么; - 多张表如何关联。 ## 三、先做数据体检 不修改原文件,先输出体检报告: - 行数、列数和文件版本; - 字段类型; - 缺失值数量与比例; - 唯一值和重复键; - 数值范围与异常极值; - 日期覆盖和断档; - 分类值拼写差异; - 表间关联成功率。 异常要区分“明显错误”“业务上可能合理”“需要负责人确认”。 ## 四、制定清洗规则 每条规则写明原值、处理方式、影响行数和原因: | 规则 | 处理前 | 处理后 | 影响 | 依据 | | --- | --- | --- | --- | --- | 原则: - 保留原始列,生成清洗列; - 不静默删除异常; - 缺失值不默认填零; - 重复记录先查业务定义; - 日期、货币和百分比统一格式; - 清洗日志可以回放。 ## 五、选择最小分析方法 ### 描述现状 计数、总和、均值、中位数、分位数、占比和分布。 ### 比较差异 按时间、渠道、地区、产品或人群分组;同时展示绝对量和比例,避免只看百分比。 ### 观察趋势 统一时间粒度,检查季节性、样本变化和断点。 ### 检查关系 散点、交叉表或相关系数只能说明共同变化;因果需要设计、对照或额外证据。 ### 发现异常 先用业务阈值,再辅以统计阈值;把异常清单交给业务确认。 ## 六、设计图表 | 问题 | 推荐图表 | | --- | --- | | 随时间变化 | 折线图 | | 类别比较 | 排序条形图 | | 构成 | 100% 堆叠或条形图 | | 分布 | 直方图、箱线图 | | 两变量关系 | 散点图 | 图表必须包含标题、单位、时间范围、口径、来源和必要注释。避免三维图、双轴误导和截断坐标造成夸大。 ## 七、写分析结论 使用四层结构: 1. **事实**:数字和图表直接支持什么; 2. **解释**:有哪些合理原因; 3. **未知**:现有数据不能判断什么; 4. **行动**:下一步核验或决策。 示例: ```text 事实:渠道 A 的净收入环比下降 18%,退款率从 4% 升至 9%。 解释:可能与本期促销商品结构变化有关。 未知:当前数据没有促销标识,尚不足以确认原因。 行动:补充活动 ID 与商品毛利字段,再分活动比较。 ``` ## 输出物 - 分析任务书; - 数据字典; - 数据质量报告; - 清洗规则与影响行数; - 指标计算表; - 图表; - 事实/解释/未知/行动结论; - 可复现步骤或脚本; - 隐私和局限说明。 ## 质量门禁 - [ ] 一行数据和唯一键定义清楚; - [ ] 指标、日期和金额口径有说明; - [ ] 原始文件没有被覆盖; - [ ] 缺失、重复和异常有处理日志; - [ ] 图表与问题匹配,单位和来源完整; - [ ] 相关性没有写成因果; - [ ] 关键数字可由独立计算复核; - [ ] 敏感字段已脱敏或留在本地; - [ ] 结论明确写出未知与限制。 检查表见 [references/analysis-checklist.md](references/analysis-checklist.md)。 ## 使用入口 - [飞书中文教程](https://m2wlgni9k4.feishu.cn/wiki/L5gTwZbhsiNeWske6GccazwAnJg) - [SkillHub 安装页](https://skillhub.cn/skills/lls-ai-data-analysis-starter) - [GitHub 源码](https://github.com/PhilRobinluo/ai-coevolution-skills/tree/main/skills/lls-ai-data-analysis-starter) - [GitHub 1.1.0 安装包](https://github.com/PhilRobinluo/ai-coevolution-skills/releases/download/lls-ai-data-analysis-starter-v1.1.0/lls-ai-data-analysis-starter-1.1.0.zip) 如果这套流程帮你第一次把数据说清楚,欢迎给总仓库点一个 Star;需要新版提醒时,请订阅 GitHub Releases。