9 added, 1 removed. Audit A to A.
---
name: lls-ai-data-analysis-starter
description: "带普通用户把 Excel、CSV 或表格问题转成可复核的数据分析。用于第一次做数据清洗、描述统计、分组比较、趋势、异常检查、图表和结论汇报时;必须先明确业务问题、字段含义、时间范围与统计口径,再检查数据质量并生成可重复步骤,不把相关性写成因果,也不根据缺失数据编造结论。"
license: CC-BY-NC-SA-4.0
metadata:
short-description: 从业务问题和数据字典开始,完成可复核的数据分析
---
<!-- workbuddy-install: published; slug: lls-ai-data-analysis-starter -->
## 在 WorkBuddy 中找到并安装
- 在 WorkBuddy 搜索唯一 slug `lls-ai-data-analysis-starter`,仅在 slug 完全一致时安装;安装后核对 `SKILL.md` 的 `name`,再新开会话使用。
+ **Skill slug:`lls-ai-data-analysis-starter`**
+
+ 在 WorkBuddy 新会话粘贴:
+
+ ```text
+ 请按 https://skillhub.cn/install/skillhub.md 检查 SkillHub,搜索 `lls-ai-data-analysis-starter`;仅在 slug 完全一致时安装到 `~/.workbuddy/skills/`。安装后读取 `~/.workbuddy/skills/lls-ai-data-analysis-starter/SKILL.md`,核对 name、version 和实际路径,然后新开会话触发该 Skill。
+ ```
+
+ 也可以打开左侧「技能」→「添加技能 / 查找技能」,搜索 `lls-ai-data-analysis-starter` 后安装;界面文字可能随 WorkBuddy 版本变化。
# 罗老师 AI 数据分析入门助手
## 核心原则
分析不是“把表格丢给 AI 问有什么发现”。正确顺序是:
1. 明确要支持的业务判断;
2. 了解每一列代表什么;
3. 检查数据是否足以回答;
4. 按可重复步骤清洗和计算;
5. 用图表与数字表达;
6. 把事实、解释和建议分开;
7. 让另一人可以复核。
## 一、定义分析问题
将模糊需求改成可计算问题:
- 模糊:“看看销售数据。”
- 清楚:“比较今年第二季度各渠道的有效订单数、净收入和退款率,并找出与第一季度变化最大的渠道。”
任务书至少包含:
```text
使用者:
要做的决定:
分析对象:
时间范围:
核心指标:
比较维度:
排除范围:
输出形式:
```
## 二、建立数据字典
| 字段 | 含义 | 类型 | 单位 | 示例 | 缺失规则 | 是否敏感 |
| --- | --- | --- | --- | --- | --- | --- |
特别确认:
- 一行代表订单、客户、事件还是汇总;
- 日期是创建、支付、完成还是统计日期;
- 金额含税、未税、退款前还是退款后;
- 状态字段有哪些合法值;
- 唯一键是什么;
- 多张表如何关联。
## 三、先做数据体检
不修改原文件,先输出体检报告:
- 行数、列数和文件版本;
- 字段类型;
- 缺失值数量与比例;
- 唯一值和重复键;
- 数值范围与异常极值;
- 日期覆盖和断档;
- 分类值拼写差异;
- 表间关联成功率。
异常要区分“明显错误”“业务上可能合理”“需要负责人确认”。
## 四、制定清洗规则
每条规则写明原值、处理方式、影响行数和原因:
| 规则 | 处理前 | 处理后 | 影响 | 依据 |
| --- | --- | --- | --- | --- |
原则:
- 保留原始列,生成清洗列;
- 不静默删除异常;
- 缺失值不默认填零;
- 重复记录先查业务定义;
- 日期、货币和百分比统一格式;
- 清洗日志可以回放。
## 五、选择最小分析方法
### 描述现状
计数、总和、均值、中位数、分位数、占比和分布。
### 比较差异
按时间、渠道、地区、产品或人群分组;同时展示绝对量和比例,避免只看百分比。
### 观察趋势
统一时间粒度,检查季节性、样本变化和断点。
### 检查关系
散点、交叉表或相关系数只能说明共同变化;因果需要设计、对照或额外证据。
### 发现异常
先用业务阈值,再辅以统计阈值;把异常清单交给业务确认。
## 六、设计图表
| 问题 | 推荐图表 |
| --- | --- |
| 随时间变化 | 折线图 |
| 类别比较 | 排序条形图 |
| 构成 | 100% 堆叠或条形图 |
| 分布 | 直方图、箱线图 |
| 两变量关系 | 散点图 |
图表必须包含标题、单位、时间范围、口径、来源和必要注释。避免三维图、双轴误导和截断坐标造成夸大。
## 七、写分析结论
使用四层结构:
1. **事实**:数字和图表直接支持什么;
2. **解释**:有哪些合理原因;
3. **未知**:现有数据不能判断什么;
4. **行动**:下一步核验或决策。
示例:
```text
事实:渠道 A 的净收入环比下降 18%,退款率从 4% 升至 9%。
解释:可能与本期促销商品结构变化有关。
未知:当前数据没有促销标识,尚不足以确认原因。
行动:补充活动 ID 与商品毛利字段,再分活动比较。
```
## 输出物
- 分析任务书;
- 数据字典;
- 数据质量报告;
- 清洗规则与影响行数;
- 指标计算表;
- 图表;
- 事实/解释/未知/行动结论;
- 可复现步骤或脚本;
- 隐私和局限说明。
## 质量门禁
- [ ] 一行数据和唯一键定义清楚;
- [ ] 指标、日期和金额口径有说明;
- [ ] 原始文件没有被覆盖;
- [ ] 缺失、重复和异常有处理日志;
- [ ] 图表与问题匹配,单位和来源完整;
- [ ] 相关性没有写成因果;
- [ ] 关键数字可由独立计算复核;
- [ ] 敏感字段已脱敏或留在本地;
- [ ] 结论明确写出未知与限制。
检查表见 [references/analysis-checklist.md](references/analysis-checklist.md)。
## 使用入口
- [飞书中文教程](https://m2wlgni9k4.feishu.cn/wiki/L5gTwZbhsiNeWske6GccazwAnJg)
- [SkillHub 安装页](https://skillhub.cn/skills/lls-ai-data-analysis-starter)
- [GitHub 源码](https://github.com/PhilRobinluo/ai-coevolution-skills/tree/main/skills/lls-ai-data-analysis-starter)
- [GitHub 1.1.0 安装包](https://github.com/PhilRobinluo/ai-coevolution-skills/releases/download/lls-ai-data-analysis-starter-v1.1.0/lls-ai-data-analysis-starter-1.1.0.zip)
如果这套流程帮你第一次把数据说清楚,欢迎给总仓库点一个 Star;需要新版提醒时,请订阅 GitHub Releases。