---
name: lls-ai-data-analysis-starter
description: "带普通用户把 Excel、CSV 或表格问题转成可复核的数据分析。用于第一次做数据清洗、描述统计、分组比较、趋势、异常检查、图表和结论汇报时；必须先明确业务问题、字段含义、时间范围与统计口径，再检查数据质量并生成可重复步骤，不把相关性写成因果，也不根据缺失数据编造结论。"
license: CC-BY-NC-SA-4.0
metadata:
  short-description: 从业务问题和数据字典开始，完成可复核的数据分析
---

<!-- workbuddy-install: published; slug: lls-ai-data-analysis-starter -->
## 在 WorkBuddy 中找到并安装

在 WorkBuddy 搜索唯一 slug `lls-ai-data-analysis-starter`，仅在 slug 完全一致时安装；安装后核对 `SKILL.md` 的 `name`，再新开会话使用。

# 罗老师 AI 数据分析入门助手

## 核心原则

分析不是“把表格丢给 AI 问有什么发现”。正确顺序是：

1. 明确要支持的业务判断；
2. 了解每一列代表什么；
3. 检查数据是否足以回答；
4. 按可重复步骤清洗和计算；
5. 用图表与数字表达；
6. 把事实、解释和建议分开；
7. 让另一人可以复核。

## 一、定义分析问题

将模糊需求改成可计算问题：

- 模糊：“看看销售数据。”
- 清楚：“比较今年第二季度各渠道的有效订单数、净收入和退款率，并找出与第一季度变化最大的渠道。”

任务书至少包含：

```text
使用者：
要做的决定：
分析对象：
时间范围：
核心指标：
比较维度：
排除范围：
输出形式：
```

## 二、建立数据字典

| 字段 | 含义 | 类型 | 单位 | 示例 | 缺失规则 | 是否敏感 |
| --- | --- | --- | --- | --- | --- | --- |

特别确认：

- 一行代表订单、客户、事件还是汇总；
- 日期是创建、支付、完成还是统计日期；
- 金额含税、未税、退款前还是退款后；
- 状态字段有哪些合法值；
- 唯一键是什么；
- 多张表如何关联。

## 三、先做数据体检

不修改原文件，先输出体检报告：

- 行数、列数和文件版本；
- 字段类型；
- 缺失值数量与比例；
- 唯一值和重复键；
- 数值范围与异常极值；
- 日期覆盖和断档；
- 分类值拼写差异；
- 表间关联成功率。

异常要区分“明显错误”“业务上可能合理”“需要负责人确认”。

## 四、制定清洗规则

每条规则写明原值、处理方式、影响行数和原因：

| 规则 | 处理前 | 处理后 | 影响 | 依据 |
| --- | --- | --- | --- | --- |

原则：

- 保留原始列，生成清洗列；
- 不静默删除异常；
- 缺失值不默认填零；
- 重复记录先查业务定义；
- 日期、货币和百分比统一格式；
- 清洗日志可以回放。

## 五、选择最小分析方法

### 描述现状

计数、总和、均值、中位数、分位数、占比和分布。

### 比较差异

按时间、渠道、地区、产品或人群分组；同时展示绝对量和比例，避免只看百分比。

### 观察趋势

统一时间粒度，检查季节性、样本变化和断点。

### 检查关系

散点、交叉表或相关系数只能说明共同变化；因果需要设计、对照或额外证据。

### 发现异常

先用业务阈值，再辅以统计阈值；把异常清单交给业务确认。

## 六、设计图表

| 问题 | 推荐图表 |
| --- | --- |
| 随时间变化 | 折线图 |
| 类别比较 | 排序条形图 |
| 构成 | 100% 堆叠或条形图 |
| 分布 | 直方图、箱线图 |
| 两变量关系 | 散点图 |

图表必须包含标题、单位、时间范围、口径、来源和必要注释。避免三维图、双轴误导和截断坐标造成夸大。

## 七、写分析结论

使用四层结构：

1. **事实**：数字和图表直接支持什么；
2. **解释**：有哪些合理原因；
3. **未知**：现有数据不能判断什么；
4. **行动**：下一步核验或决策。

示例：

```text
事实：渠道 A 的净收入环比下降 18%，退款率从 4% 升至 9%。
解释：可能与本期促销商品结构变化有关。
未知：当前数据没有促销标识，尚不足以确认原因。
行动：补充活动 ID 与商品毛利字段，再分活动比较。
```

## 输出物

- 分析任务书；
- 数据字典；
- 数据质量报告；
- 清洗规则与影响行数；
- 指标计算表；
- 图表；
- 事实/解释/未知/行动结论；
- 可复现步骤或脚本；
- 隐私和局限说明。

## 质量门禁

- [ ] 一行数据和唯一键定义清楚；
- [ ] 指标、日期和金额口径有说明；
- [ ] 原始文件没有被覆盖；
- [ ] 缺失、重复和异常有处理日志；
- [ ] 图表与问题匹配，单位和来源完整；
- [ ] 相关性没有写成因果；
- [ ] 关键数字可由独立计算复核；
- [ ] 敏感字段已脱敏或留在本地；
- [ ] 结论明确写出未知与限制。

检查表见 [references/analysis-checklist.md](references/analysis-checklist.md)。

## 使用入口

- [飞书中文教程](https://m2wlgni9k4.feishu.cn/wiki/L5gTwZbhsiNeWske6GccazwAnJg)
- [SkillHub 安装页](https://skillhub.cn/skills/lls-ai-data-analysis-starter)
- [GitHub 源码](https://github.com/PhilRobinluo/ai-coevolution-skills/tree/main/skills/lls-ai-data-analysis-starter)
- [GitHub 1.1.0 安装包](https://github.com/PhilRobinluo/ai-coevolution-skills/releases/download/lls-ai-data-analysis-starter-v1.1.0/lls-ai-data-analysis-starter-1.1.0.zip)

如果这套流程帮你第一次把数据说清楚，欢迎给总仓库点一个 Star；需要新版提醒时，请订阅 GitHub Releases。
