---
name: humanizer-formal
description: 降低商务与学术文本的 AI 生成感，中英文均适用。Removes AI-writing patterns from business and academic prose, in both Chinese and English. 用于审校已写好的报告、备忘录、论文、摘要、执行摘要，或在起草时预防机器腔。当用户要求「去 AI 味」「让文字更像人写的」「润色成正式书面语」「检查这段像不像 AI 写的」，或提交商务、学术文本请求改写时使用。Use when the user asks to humanize, de-slop, or remove the AI tone from a report, memo, paper, abstract, or executive summary. 不适用于随笔、营销文案、社交媒体、创意写作。Not for essays, marketing copy, social media, or creative writing.
license: MIT. LICENSE has complete terms
---
# 商务与学术文本去 AI 感

## 这个 skill 解决什么

AI 写的商务和学术文本有两类毛病，**成因不同，处理方式相反**：

- **A 类｜机器痕迹**：人写不出来的东西。连接词过密、限定语泛滥、“的”字堆叠、
  破折号乱用、搭配错配。**一律要改**。
- **B 类｜语域不符**：人也这么写，但不该出现在你这份文档里。抽象名词、
  buzzword、名词化、比喻、外来语直译。**按目标语域调整，不是一律删**。

混为一谈是最常见的错误。实测显示机器翻译的中文里抽象名词密度是全部语料中
**最低**的，比教科书还低，人写的白皮书和咨询报告里最高。所以看到
「赋能、闭环、生态、体系」就判定是 AI 写的，这个判断是错的。

先分类，再动手。

## 第一步：确定目标语域

分五级：

| 级别 | 中文样例 | 用在哪 |
|---|---|---|
| L1 论文腔／公文腔 | 本研究基于多维指标体系，对目标企业经营绩效进行了系统性实证考察，结果表明其在成本控制维度呈现显著的边际改善态势。 | 期刊投稿、政府公文 |
| **L2 标准学术与专业商务** | **我们用五项指标评估了该公司的经营绩效。结果显示，其成本控制在样本期内显著改善。** | **学位论文、研究报告、投资备忘录、尽调报告、行业分析、董事会材料** |
| L3 通俗说明 | 我们用五项指标衡量这家公司的经营情况。2023 到 2025 年，它的单位生产成本从 42 元降到 31 元。 | 教科书、科普、面向非专业读者的说明、对外宣传 |
| L4 口语（禁止） | 我们看了五个指标，这家公司省钱省得挺明显。 | — |
| L5 闲聊（严禁） | 说实话，这公司控成本真挺猛的，你敢信？ | — |

英文同理，L2 `We evaluated the firm's performance on five indicators. Unit
production cost fell 26% over the sample period.`

**L3 的判据**：句子短、词常见、结构直白，但**不出现**语气词、人称抒情、
市井词汇、缩略口语、感叹和反问。降级降的是**句法复杂度和抽象名词密度**，
不是降正式度。“更简单”不等于“更随便”，这是本 skill 最容易误解的一点。

### 语域适用范围　`设计`

没有明确指示时，**输出一律按 L3 为准**：解释、建议、变更清单、可选方案都按
L3 写。

**写正文时按该文档的目标语域执行，未指明目标时取 L2。** 正文指会原样进入
成稿的文字：改写后的段落、句子、标题，以及因平台限制只能直接写在对话里的
文档内容。

判据是去向不是格式：这段文字会不会原样出现在成稿里。会，按目标语域；不会，
按 L3。能用引用块把两者分开时就分开，格式只标记边界。

**L4 与 L5 在任何情况下禁止**，对话部分同样不出现语气词、缩略口语、感叹
和反问。用户说“要正式些”走 L2，说“投期刊”走 L1。

### 术语量按证据密度调　`设计`

专业度有两个来源，证据和术语，两者互补。数字密集的段落不需要术语撑专业度，
数字稀薄的段落（理论章节、机制讨论、局限说明）才靠术语维持语域。
**有足够数字或出处支撑时，降低术语量。**

这一条在目标语域确定之后执行，调的是同一语域内的术语密度，不改变语域级别。

## 第二步：按类别处理

**各条列出的词只是示例，不是完整清单。** 坏搭配、buzzword、外来语直译都列
不完，靠匹配词表只能查出最明显的那几个。判断必须逐句做：看这句话里的每个
动宾搭配、每个定中搭配、每个选词，而不是拿词表去扫。**词表用来提示该往哪
类问题上想，不是用来代替阅读。**

编号与 `references/patterns-zh.md` 一致。本文件只收最高频的条目，编号因此
不连续。可信度标注：`实测`＝本项目语料验证过；`沿用`＝继承上游，未验证；
`设计`＝明确的设计决定，不是测量结论。实测取值与完整例句见
`references/patterns-zh.md` 与 `patterns-en.md`。

### A 类规则：机器痕迹，一律改

**A1 连接词过密**　`实测·中文`

中文靠语序和意合衔接，不靠显式连接词。机器把英文的连接词规范整套搬进中文，
还会超量添加。

- 自然频率：大约**每 10 句出现一次**显式连接词
- 危险信号：每 4 到 5 句就出现一次「因此、然而、此外、并且、从而」

> 需求走弱。因此，产能利用率下降。此外，库存周期延长。并且，价格竞争加剧 →
> 需求走弱，产能利用率下降，库存周期延长，价格竞争加剧

改法是删掉连接词后，靠语序、分句和句号表达逻辑。英译中时原文的连接词
**大约要删掉一半**。

---

**A2 无差别限定**　`实测·中文`

英文学术散文用「may / could / suggest」是常态，中文书面语用得少得多。机器
保留英文的限定密度，中文读起来就像什么都不敢说。

- 危险信号：一个段落里出现两个以上「可能、或许、似乎、倾向于」

处理原则不是一律删，而是**让限定强度与证据强度相称**：

> 数据可能表明成本或许在一定程度上有所下降，这似乎倾向于说明管理效率
> 可能有所改善 → 单位成本下降 26%。这一变化主要来自能耗改善，管理效率的
> 影响尚无法分离

有把握的直说，没把握的说清楚不确定在哪里，不要对每句话都加限定。

**注意区分**：「约、左右、近」是**数值近似**，不是认知限定。数据密集的报告里
出现几十次「约」是精确性的体现，不要删。

**反向检查**：改完看有没有出现过度确定的句子。绝对化断言（「不是 X」「一律」
「总是」）如果证据只支持多数情况，要把限定语补回去。删限定语和加限定语是
同一条规则的两面，本条不是单向削减。

---

**A3 「的」字堆叠与嵌套**　`实测·中文`

欧化定语直译的产物。危险信号：单句 3 个以上「的」，或出现「X 的 Y 的 Z」嵌套。

> 以获得他们对未来相关性将如何的最佳估计 → 以估计未来的相关性

改法是**把定语拆成谓语**。定语一长就往后拆成分句，不要堆在名词前面。

---

**A5 「被」字滥用**　`实测·中文`

英文被动直译。中文表被动手段更多，很多情况下根本不需要标记。改法优先级：
改主动 → 用「受、由、经、获」→ 保留「被」（仅在强调受害或确实需要标记时）。

---

**A6 轻动词结构**　`实测·中文`

「进行、加以、予以、作出」加名词化动词，是翻译腔的典型标记。

> 对上述数据进行了系统性的分析 → 分析了上述数据；对结论加以验证 → 验证了结论

---

**A7 中文破折号**　`实测·中文`

人写中文各语域正文里密度接近零，教科书和政府公文是精确的零。机器用它做
戏剧性揭示。按 GB/T 15834 中文破折号是全角 `——`，合法用途只有解释说明和
话题转换，商务学术正文里**改用逗号、冒号或括号**。

> 结论很明确——成本控制是唯一可行的路径 → 结论很明确：成本控制是唯一可行的路径

---

**A8 「请注意」类祈使句**　`实测·中文`

`Note that` 的直译。七组人写中文语料里出现频率**全部为零**，是最接近二值
判据的一条。改法是把它承载的转折并进句子。「值得注意的是」是合法的中文
衔接词，可以保留，但一篇里别超过一两次。

---

**A22 搭配错配**　`设计·中文`

词都对，配对在中文里没有。模型按语义角色组合词，母语写作者按既有说法取用，
两者的产物不一样。这一类是**词表查不出来的**，只能逐句反查。

**判据一，反查常规宾语。** 拿动词想它最常搭配的三到五个宾语。目标宾语不在
其中、也不属于同一语义类，就是错配。

> 磨 → 刀、墨、豆子。排比不在其中：**磨掉排比** → 拆散排比
> 承担 → 责任、费用、风险、后果。语域不在其中：**承担语域** → 维持语域

**判据二，看需不需要辩护。** 要解释这个搭配为什么成立，它就不成立。既有
搭配是取用来的，不需要论证。

**改法：先说出实际发生了什么，再选那件事的常规动词。**「磨掉排比」里实际
发生的是翻译把排比拆成了散句，那就写「拆成散句」。

三种形态：动宾错配（磨掉排比、承担语域）、定中生造（深度赋能、全面打通）、
术语跨域挪用（护栏、对齐、降档、跑偏）。第三种与 B1、B5 重叠，按 B 族处理；
前两种归 A 族，一律改。

**规则名、标题、清单项优先受检。** 它们会被复制到别处，一处错误会变成多处。

---

**英文侧：名词化与虚位主语**　`沿用·英文`

英文侧未经本项目语料验证，按上游规则执行。

- `conduct an analysis` → `analyze`
- `There is a need to reduce costs` → `Costs must fall`
- `the improvement of the efficiency of the process` → `process efficiency gains`

方法学章节的被动语态是合法的，不要一律改主动。

---

**中英通用：聊天残留与元评论**　`沿用·中英`

删掉「希望这对你有帮助」「以下是……」「让我为你分析一下」、知识截止声明、
能力免责、「作为一个 AI」类自我指称。正文里不出现表情符号，商务学术场合
零容忍。

---

**D1 不要拆散四字格和排比**　`实测·中文·反向规则`

这一条**禁止改写**，放在这里是因为它最容易被 A 族规则误伤。实测显示人写
中文使用三字格和四字格排比的频率是机器翻译的 **2 到 10 倍**。排比是汉语的
本土节奏手段，机器不会用。看到「稳增长、调结构、促创新」这类结构，
**不要拆成散句**。

唯一例外：空洞的宣传口号连排（「高质量发展、深层次变革、全方位提升」且不含
具体信息）按 B 类处理，理由是语域不合，不是像机器写的。

---

### B 类规则：语域不符，按目标调整

判据是**这份文档该用多少**，不是“超过多少就是 AI”。实测的抽象名词阶梯：

```
英文   教科书  <  10-K  <  联合国文件  <  政府白皮书
中文   教科书  <  年报  <  央行报告  <  白皮书  <  咨询研究报告
```

**B1 抽象名词与 buzzword**　`实测·中英`

中文：赋能、闭环、抓手、生态、护城河、飞轮、颗粒度、打通、对齐、组合拳
英文：landscape、ecosystem、paradigm、synergy、holistic、leverage、framework

判断方法：**删掉这个词，句子的信息量有变化吗？** 没有就删。

> 通过数字化赋能打通产业链堵点，构建全方位的产业生态闭环 →
> 把订单数据接入供应商系统，交货周期从 21 天压缩到 9 天

「体系、机制」在央行与政策文本里有确切所指，不要一律删。判据始终是有无所指。

**B2 增强语堆砌**　`实测·中英`

中文：至关重要、显著、全面、深入、有力、高质量、切实、大力
英文：significant、crucial、essential、critical、robust、comprehensive

这些词不提供信息，只提供语气。有数据就给数据。

**B3 名词化后缀堆叠**　`实测·中文`

「性、化、度、率、力、感」。实测无区分度，人写区间完全覆盖机器区间，
所以只是语域标记，不作机器痕迹判据。

**B4 比喻的使用**　`设计·中英`

**说明性类比**：用熟悉的事物解释陌生机制，本体与喻体都点明，带显式标记
（相当于、类似于、可以看作）。判据是删掉它读者还能不能理解这个机制，不能
就保留。约束按局部算，不按篇幅算：一个机制一个类比，同段不超过一处，
相邻两段不连续。全文无上限。**该给却不给，同样是缺陷。**

**修辞性比喻**：本体已说清，比喻只添色彩，一律改直陈。三种形态：暗喻、
抽象操作物理化（挂数据、砍掉、打通、闭环、抓手）、拟人（数据告诉我们）。
判据同 B1。

> 整套规则挂在一把五级标尺上 → 规则分五级

**方向性词语**：「方向相反、反过来、搞错了方向」是空间比喻，机器用得远多于
人。判据是**能不能指出那条轴**：说得出哪个量沿哪个方向变化、不等号怎么翻转，
保留；说不出，按实际关系改写成「冲突」「错误」「不同」。反向要求按 A2
校准：真有方向翻转却写成「不同」，是信息损失。

警句式比喻（「数据是新时代的石油」）是本条的极端形态，见 A17。

**B5 优先使用中文固有词**　`设计·中文`

材料与用户都没有指定术语时，选词优先用中文固有说法，不用外来语直译。

**判据：这个词是不是某个英文词的直译，而中文里本来另有说法。** 下面的对照
只是示例，不是清单，直译词列不完。

> 基线 → 标准；场景 → 情况；维度 → 方面；复用 → 重复使用；对标 → 参照；
> 落地 → 实施；触达 → 送达；链路 → 环节；护栏 → 例外、限制

两条例外。一、**本领域中文文献通用的术语不算**：语域、名词化、分位数、
变异系数都是借来的或新造的，但它们是各自领域的通用说法，换掉反而看不懂。
二、**没有自然的替换就保留**，不要硬造。

这条换的是词的来源，不是层级。标准和基线一样专业。材料里已出现的术语按
D2 一字不变地复现。

### 按目标语域取值

- **执行摘要、投资备忘录、尽调报告**：参照 10-K，抽象名词降到最低，结论
  前置，每个判断给出数据
- **学术论文**：参照教科书与专著，允许适度名词化，限定语与证据强度相称
- **政策建议、白皮书**：抽象名词密度天然较高，但仍要求每个概念后面有具体做法

## 判定纪律

### 共现才算证据

**单个指标不构成判定依据。** 几乎每个指标的人写区间和机器区间都相邻，有些
直接重叠。中文侧的连接词和认知限定是少数无重叠的例外。

一个破折号、一次「此外」、一个弯引号都说明不了任何事。**同一段出现两处以上
不同痕迹才是修改信号，超过两处已经影响阅读观感。** 注意是**不同**痕迹共现，
不是同一痕迹反复出现。

### 不要误判为 AI 的东西

以下特征单独出现时**不是** AI 痕迹：文字干净风格统一、正式或学术词汇、
孤立的连接词、弯引号与全角标点、单个破折号、单个短句、没有引用、规范的
复杂排版、引文与标题内部的敏感词、合理的免责与范围声明、读者真会考虑的
备选方案。

最容易误伤的三处：**引文内部不改**，被讨论的词和被使用的词不一样；**法律
与安全提示不删**，那是责任要求；**设计文档里的备选方案不删**。逐条理由见
`patterns-zh.md` 的假阳性防护一节。

### 要保留的人写痕迹

除非损害准确性一律保留：具体而不寻常的细节、未解决的张力（「这个结论我
大致相信，但有一点始终解释不通」）、句长的自然起伏、真实的自我修正与
插入语、有据可依的第一人称选择。

## 第三步：两种使用模式

### 审校模式（默认）

1. 判定目标语域（正文默认 L2，对话按 L3）
2. **逐句读一遍**，标出 A 类问题。这一步有两种检查，都要做：一是词表提示的
   那几类（连接词、限定语、「的」、「被」、轻动词、破折号），二是词表查不到
   的搭配问题（A22），后者要逐句取出动宾对和定中对反查常规搭配。
   **不要用词表代替阅读。**
3. 确认痕迹是否共现，不要凭单条下判断，再改 A 类
4. 对照目标语域检查 B 类，按需调整
5. **改完自查两个问题**：还有哪里读着像机器写的？**改写有没有增加或删除
   任何事实、名称、数字、日期、引语、引用、排序或其他主张？** 任何无依据的
   新增或丢失都算错误，必须回退。
6. 输出

第 5 步的第二问是硬性的。去 AI 味的过程中丢掉一个数字，比留着 AI 味严重得多。

### 起草模式

写之前先定语域，然后结论前置，不要背景铺垫开场；每个判断后面跟数据、出处
或明确的不确定性说明；想写抽象名词时先问能不能换成具体动作；连接词能省
就省；**动宾与定中搭配取汉语里既有的说法，不按语义拼合新的**。写完自查
A1、A2、A8、A22 四条，这四条最容易犯。

## 输出形态

**粘贴文本（默认）**　改写稿放进引用块按目标语域；变更清单在块外按 L3，
每条注明命中的规则编号和理由。商务场合改稿常要向上解释依据。

**指定文件**　跑完整流程，只把最终文本写进文件，然后给一句话摘要，摘要
留在对话里按 L3。**只改散体文字**：代码块、YAML、数据表、链接地址、公式
一律不动。

**其他任务调用时**　只返回最终文本，不附清单和说明。

## 绝不做的事

- 不要为了“像人写的”注入个人情绪、幽默、锋芒或第一人称抒情，商务学术
  语境里这会直接损害可信度
- 不要把语域降到 L4 以下，正文与对话都一样
- 不要改动数字、单位、口径、专有名词，以及**材料里的术语**。材料里的术语
  必须一字不变地复现。改写中自己新造的说法不在此列，同样要过 A22
- 不要删除有证据支撑的限定语。10-K 风险因素章节的限定语是法律要求
- 不要凭 buzzword 密度判定文本是 AI 写的，那是语域标记不是作者身份标记
- 不要编造引用、DOI 或数据来源。原文没有出处就标注缺失，不要补一个
- 不要拿词表当检查清单。词表列的是示例，漏网的永远比列出的多

## 参考文件

- `references/patterns-zh.md`　中文条目全表、实测取值、假阳性防护逐条理由
- `references/patterns-en.md`　英文条目全表，含实测否定的三条规则
- `references/register-business.md`　商务文体：金字塔原理、执行摘要、图表与建议表述
- `references/register-academic.md`　学术文体：IMRaD、CARS、元话语校准、引用可核查性

语料构成、量化依据与已知局限见仓库根目录的研究说明文档。许可与衍生关系见
`LICENSE` 与 `NOTICE.md`。
