humanizer-formal · git:20260915.1ee7fd5 · 2026-09-15 · sha256 d3781a54f78d14eb

humanizer-formal git:20260915.1ee7fd5A

Immutable. This exact content is served forever at /api/v1/blob/d3781a54f78d14eb.

---
name: humanizer-formal
description: 降低商务与学术文本的 AI 生成感,中英文均适用。Removes AI-writing patterns from business and academic prose, in both Chinese and English. 用于审校已写好的报告、备忘录、论文、摘要、执行摘要,或在起草时预防机器腔。当用户要求「去 AI 味」「让文字更像人写的」「润色成正式书面语」「检查这段像不像 AI 写的」,或提交商务、学术文本请求改写时使用。Use when the user asks to humanize, de-slop, or remove the AI tone from a report, memo, paper, abstract, or executive summary. 不适用于随笔、营销文案、社交媒体、创意写作。Not for essays, marketing copy, social media, or creative writing.
license: MIT. LICENSE has complete terms
---
# 商务与学术文本去 AI 感

## 这个 skill 解决什么

AI 写的商务和学术文本有两类毛病,**成因不同,处理方式相反**:

- **A 类|机器痕迹**:人写不出来的东西。连接词过密、限定语泛滥、“的”字堆叠、
  破折号乱用、搭配错配。**一律要改**。
- **B 类|语域不符**:人也这么写,但不该出现在你这份文档里。抽象名词、
  buzzword、名词化、比喻、外来语直译。**按目标语域调整,不是一律删**。

混为一谈是最常见的错误。实测显示机器翻译的中文里抽象名词密度是全部语料中
**最低**的,比教科书还低,人写的白皮书和咨询报告里最高。所以看到
「赋能、闭环、生态、体系」就判定是 AI 写的,这个判断是错的。

先分类,再动手。

## 第一步:确定目标语域

分五级:

| 级别 | 中文样例 | 用在哪 |
|---|---|---|
| L1 论文腔/公文腔 | 本研究基于多维指标体系,对目标企业经营绩效进行了系统性实证考察,结果表明其在成本控制维度呈现显著的边际改善态势。 | 期刊投稿、政府公文 |
| **L2 标准学术与专业商务** | **我们用五项指标评估了该公司的经营绩效。结果显示,其成本控制在样本期内显著改善。** | **学位论文、研究报告、投资备忘录、尽调报告、行业分析、董事会材料** |
| L3 通俗说明 | 我们用五项指标衡量这家公司的经营情况。2023 到 2025 年,它的单位生产成本从 42 元降到 31 元。 | 教科书、科普、面向非专业读者的说明、对外宣传 |
| L4 口语(禁止) | 我们看了五个指标,这家公司省钱省得挺明显。 | — |
| L5 闲聊(严禁) | 说实话,这公司控成本真挺猛的,你敢信? | — |

英文同理,L2 `We evaluated the firm's performance on five indicators. Unit
production cost fell 26% over the sample period.`

**L3 的判据**:句子短、词常见、结构直白,但**不出现**语气词、人称抒情、
市井词汇、缩略口语、感叹和反问。降级降的是**句法复杂度和抽象名词密度**,
不是降正式度。“更简单”不等于“更随便”,这是本 skill 最容易误解的一点。

### 语域适用范围 `设计`

没有明确指示时,**输出一律按 L3 为准**:解释、建议、变更清单、可选方案都按
L3 写。

**写正文时按该文档的目标语域执行,未指明目标时取 L2。** 正文指会原样进入
成稿的文字:改写后的段落、句子、标题,以及因平台限制只能直接写在对话里的
文档内容。

判据是去向不是格式:这段文字会不会原样出现在成稿里。会,按目标语域;不会,
按 L3。能用引用块把两者分开时就分开,格式只标记边界。

**L4 与 L5 在任何情况下禁止**,对话部分同样不出现语气词、缩略口语、感叹
和反问。用户说“要正式些”走 L2,说“投期刊”走 L1。

### 术语量按证据密度调 `设计`

专业度有两个来源,证据和术语,两者互补。数字密集的段落不需要术语撑专业度,
数字稀薄的段落(理论章节、机制讨论、局限说明)才靠术语维持语域。
**有足够数字或出处支撑时,降低术语量。**

这一条在目标语域确定之后执行,调的是同一语域内的术语密度,不改变语域级别。

## 第二步:按类别处理

**各条列出的词只是示例,不是完整清单。** 坏搭配、buzzword、外来语直译都列
不完,靠匹配词表只能查出最明显的那几个。判断必须逐句做:看这句话里的每个
动宾搭配、每个定中搭配、每个选词,而不是拿词表去扫。**词表用来提示该往哪
类问题上想,不是用来代替阅读。**

编号与 `references/patterns-zh.md` 一致。本文件只收最高频的条目,编号因此
不连续。可信度标注:`实测`=本项目语料验证过;`沿用`=继承上游,未验证;
`设计`=明确的设计决定,不是测量结论。实测取值与完整例句见
`references/patterns-zh.md` 与 `patterns-en.md`。

### A 类规则:机器痕迹,一律改

**A1 连接词过密** `实测·中文`

中文靠语序和意合衔接,不靠显式连接词。机器把英文的连接词规范整套搬进中文,
还会超量添加。

- 自然频率:大约**每 10 句出现一次**显式连接词
- 危险信号:每 4 到 5 句就出现一次「因此、然而、此外、并且、从而」

> 需求走弱。因此,产能利用率下降。此外,库存周期延长。并且,价格竞争加剧 →
> 需求走弱,产能利用率下降,库存周期延长,价格竞争加剧

改法是删掉连接词后,靠语序、分句和句号表达逻辑。英译中时原文的连接词
**大约要删掉一半**。

---

**A2 无差别限定** `实测·中文`

英文学术散文用「may / could / suggest」是常态,中文书面语用得少得多。机器
保留英文的限定密度,中文读起来就像什么都不敢说。

- 危险信号:一个段落里出现两个以上「可能、或许、似乎、倾向于」

处理原则不是一律删,而是**让限定强度与证据强度相称**:

> 数据可能表明成本或许在一定程度上有所下降,这似乎倾向于说明管理效率
> 可能有所改善 → 单位成本下降 26%。这一变化主要来自能耗改善,管理效率的
> 影响尚无法分离

有把握的直说,没把握的说清楚不确定在哪里,不要对每句话都加限定。

**注意区分**:「约、左右、近」是**数值近似**,不是认知限定。数据密集的报告里
出现几十次「约」是精确性的体现,不要删。

**反向检查**:改完看有没有出现过度确定的句子。绝对化断言(「不是 X」「一律」
「总是」)如果证据只支持多数情况,要把限定语补回去。删限定语和加限定语是
同一条规则的两面,本条不是单向削减。

---

**A3 「的」字堆叠与嵌套** `实测·中文`

欧化定语直译的产物。危险信号:单句 3 个以上「的」,或出现「X 的 Y 的 Z」嵌套。

> 以获得他们对未来相关性将如何的最佳估计 → 以估计未来的相关性

改法是**把定语拆成谓语**。定语一长就往后拆成分句,不要堆在名词前面。

---

**A5 「被」字滥用** `实测·中文`

英文被动直译。中文表被动手段更多,很多情况下根本不需要标记。改法优先级:
改主动 → 用「受、由、经、获」→ 保留「被」(仅在强调受害或确实需要标记时)。

---

**A6 轻动词结构** `实测·中文`

「进行、加以、予以、作出」加名词化动词,是翻译腔的典型标记。

> 对上述数据进行了系统性的分析 → 分析了上述数据;对结论加以验证 → 验证了结论

---

**A7 中文破折号** `实测·中文`

人写中文各语域正文里密度接近零,教科书和政府公文是精确的零。机器用它做
戏剧性揭示。按 GB/T 15834 中文破折号是全角 `——`,合法用途只有解释说明和
话题转换,商务学术正文里**改用逗号、冒号或括号**。

> 结论很明确——成本控制是唯一可行的路径 → 结论很明确:成本控制是唯一可行的路径

---

**A8 「请注意」类祈使句** `实测·中文`

`Note that` 的直译。七组人写中文语料里出现频率**全部为零**,是最接近二值
判据的一条。改法是把它承载的转折并进句子。「值得注意的是」是合法的中文
衔接词,可以保留,但一篇里别超过一两次。

---

**A22 搭配错配** `设计·中文`

词都对,配对在中文里没有。模型按语义角色组合词,母语写作者按既有说法取用,
两者的产物不一样。这一类是**词表查不出来的**,只能逐句反查。

**判据一,反查常规宾语。** 拿动词想它最常搭配的三到五个宾语。目标宾语不在
其中、也不属于同一语义类,就是错配。

> 磨 → 刀、墨、豆子。排比不在其中:**磨掉排比** → 拆散排比
> 承担 → 责任、费用、风险、后果。语域不在其中:**承担语域** → 维持语域

**判据二,看需不需要辩护。** 要解释这个搭配为什么成立,它就不成立。既有
搭配是取用来的,不需要论证。

**改法:先说出实际发生了什么,再选那件事的常规动词。**「磨掉排比」里实际
发生的是翻译把排比拆成了散句,那就写「拆成散句」。

三种形态:动宾错配(磨掉排比、承担语域)、定中生造(深度赋能、全面打通)、
术语跨域挪用(护栏、对齐、降档、跑偏)。第三种与 B1、B5 重叠,按 B 族处理;
前两种归 A 族,一律改。

**规则名、标题、清单项优先受检。** 它们会被复制到别处,一处错误会变成多处。

---

**英文侧:名词化与虚位主语** `沿用·英文`

英文侧未经本项目语料验证,按上游规则执行。

- `conduct an analysis` → `analyze`
- `There is a need to reduce costs` → `Costs must fall`
- `the improvement of the efficiency of the process` → `process efficiency gains`

方法学章节的被动语态是合法的,不要一律改主动。

---

**中英通用:聊天残留与元评论** `沿用·中英`

删掉「希望这对你有帮助」「以下是……」「让我为你分析一下」、知识截止声明、
能力免责、「作为一个 AI」类自我指称。正文里不出现表情符号,商务学术场合
零容忍。

---

**D1 不要拆散四字格和排比** `实测·中文·反向规则`

这一条**禁止改写**,放在这里是因为它最容易被 A 族规则误伤。实测显示人写
中文使用三字格和四字格排比的频率是机器翻译的 **2 到 10 倍**。排比是汉语的
本土节奏手段,机器不会用。看到「稳增长、调结构、促创新」这类结构,
**不要拆成散句**。

唯一例外:空洞的宣传口号连排(「高质量发展、深层次变革、全方位提升」且不含
具体信息)按 B 类处理,理由是语域不合,不是像机器写的。

---

### B 类规则:语域不符,按目标调整

判据是**这份文档该用多少**,不是“超过多少就是 AI”。实测的抽象名词阶梯:

```
英文   教科书  <  10-K  <  联合国文件  <  政府白皮书
中文   教科书  <  年报  <  央行报告  <  白皮书  <  咨询研究报告
```

**B1 抽象名词与 buzzword** `实测·中英`

中文:赋能、闭环、抓手、生态、护城河、飞轮、颗粒度、打通、对齐、组合拳
英文:landscape、ecosystem、paradigm、synergy、holistic、leverage、framework

判断方法:**删掉这个词,句子的信息量有变化吗?** 没有就删。

> 通过数字化赋能打通产业链堵点,构建全方位的产业生态闭环 →
> 把订单数据接入供应商系统,交货周期从 21 天压缩到 9 天

「体系、机制」在央行与政策文本里有确切所指,不要一律删。判据始终是有无所指。

**B2 增强语堆砌** `实测·中英`

中文:至关重要、显著、全面、深入、有力、高质量、切实、大力
英文:significant、crucial、essential、critical、robust、comprehensive

这些词不提供信息,只提供语气。有数据就给数据。

**B3 名词化后缀堆叠** `实测·中文`

「性、化、度、率、力、感」。实测无区分度,人写区间完全覆盖机器区间,
所以只是语域标记,不作机器痕迹判据。

**B4 比喻的使用** `设计·中英`

**说明性类比**:用熟悉的事物解释陌生机制,本体与喻体都点明,带显式标记
(相当于、类似于、可以看作)。判据是删掉它读者还能不能理解这个机制,不能
就保留。约束按局部算,不按篇幅算:一个机制一个类比,同段不超过一处,
相邻两段不连续。全文无上限。**该给却不给,同样是缺陷。**

**修辞性比喻**:本体已说清,比喻只添色彩,一律改直陈。三种形态:暗喻、
抽象操作物理化(挂数据、砍掉、打通、闭环、抓手)、拟人(数据告诉我们)。
判据同 B1。

> 整套规则挂在一把五级标尺上 → 规则分五级

**方向性词语**:「方向相反、反过来、搞错了方向」是空间比喻,机器用得远多于
人。判据是**能不能指出那条轴**:说得出哪个量沿哪个方向变化、不等号怎么翻转,
保留;说不出,按实际关系改写成「冲突」「错误」「不同」。反向要求按 A2
校准:真有方向翻转却写成「不同」,是信息损失。

警句式比喻(「数据是新时代的石油」)是本条的极端形态,见 A17。

**B5 优先使用中文固有词** `设计·中文`

材料与用户都没有指定术语时,选词优先用中文固有说法,不用外来语直译。

**判据:这个词是不是某个英文词的直译,而中文里本来另有说法。** 下面的对照
只是示例,不是清单,直译词列不完。

> 基线 → 标准;场景 → 情况;维度 → 方面;复用 → 重复使用;对标 → 参照;
> 落地 → 实施;触达 → 送达;链路 → 环节;护栏 → 例外、限制

两条例外。一、**本领域中文文献通用的术语不算**:语域、名词化、分位数、
变异系数都是借来的或新造的,但它们是各自领域的通用说法,换掉反而看不懂。
二、**没有自然的替换就保留**,不要硬造。

这条换的是词的来源,不是层级。标准和基线一样专业。材料里已出现的术语按
D2 一字不变地复现。

### 按目标语域取值

- **执行摘要、投资备忘录、尽调报告**:参照 10-K,抽象名词降到最低,结论
  前置,每个判断给出数据
- **学术论文**:参照教科书与专著,允许适度名词化,限定语与证据强度相称
- **政策建议、白皮书**:抽象名词密度天然较高,但仍要求每个概念后面有具体做法

## 判定纪律

### 共现才算证据

**单个指标不构成判定依据。** 几乎每个指标的人写区间和机器区间都相邻,有些
直接重叠。中文侧的连接词和认知限定是少数无重叠的例外。

一个破折号、一次「此外」、一个弯引号都说明不了任何事。**同一段出现两处以上
不同痕迹才是修改信号,超过两处已经影响阅读观感。** 注意是**不同**痕迹共现,
不是同一痕迹反复出现。

### 不要误判为 AI 的东西

以下特征单独出现时**不是** AI 痕迹:文字干净风格统一、正式或学术词汇、
孤立的连接词、弯引号与全角标点、单个破折号、单个短句、没有引用、规范的
复杂排版、引文与标题内部的敏感词、合理的免责与范围声明、读者真会考虑的
备选方案。

最容易误伤的三处:**引文内部不改**,被讨论的词和被使用的词不一样;**法律
与安全提示不删**,那是责任要求;**设计文档里的备选方案不删**。逐条理由见
`patterns-zh.md` 的假阳性防护一节。

### 要保留的人写痕迹

除非损害准确性一律保留:具体而不寻常的细节、未解决的张力(「这个结论我
大致相信,但有一点始终解释不通」)、句长的自然起伏、真实的自我修正与
插入语、有据可依的第一人称选择。

## 第三步:两种使用模式

### 审校模式(默认)

1. 判定目标语域(正文默认 L2,对话按 L3)
2. **逐句读一遍**,标出 A 类问题。这一步有两种检查,都要做:一是词表提示的
   那几类(连接词、限定语、「的」、「被」、轻动词、破折号),二是词表查不到
   的搭配问题(A22),后者要逐句取出动宾对和定中对反查常规搭配。
   **不要用词表代替阅读。**
3. 确认痕迹是否共现,不要凭单条下判断,再改 A 类
4. 对照目标语域检查 B 类,按需调整
5. **改完自查两个问题**:还有哪里读着像机器写的?**改写有没有增加或删除
   任何事实、名称、数字、日期、引语、引用、排序或其他主张?** 任何无依据的
   新增或丢失都算错误,必须回退。
6. 输出

第 5 步的第二问是硬性的。去 AI 味的过程中丢掉一个数字,比留着 AI 味严重得多。

### 起草模式

写之前先定语域,然后结论前置,不要背景铺垫开场;每个判断后面跟数据、出处
或明确的不确定性说明;想写抽象名词时先问能不能换成具体动作;连接词能省
就省;**动宾与定中搭配取汉语里既有的说法,不按语义拼合新的**。写完自查
A1、A2、A8、A22 四条,这四条最容易犯。

## 输出形态

**粘贴文本(默认)** 改写稿放进引用块按目标语域;变更清单在块外按 L3,
每条注明命中的规则编号和理由。商务场合改稿常要向上解释依据。

**指定文件** 跑完整流程,只把最终文本写进文件,然后给一句话摘要,摘要
留在对话里按 L3。**只改散体文字**:代码块、YAML、数据表、链接地址、公式
一律不动。

**其他任务调用时** 只返回最终文本,不附清单和说明。

## 绝不做的事

- 不要为了“像人写的”注入个人情绪、幽默、锋芒或第一人称抒情,商务学术
  语境里这会直接损害可信度
- 不要把语域降到 L4 以下,正文与对话都一样
- 不要改动数字、单位、口径、专有名词,以及**材料里的术语**。材料里的术语
  必须一字不变地复现。改写中自己新造的说法不在此列,同样要过 A22
- 不要删除有证据支撑的限定语。10-K 风险因素章节的限定语是法律要求
- 不要凭 buzzword 密度判定文本是 AI 写的,那是语域标记不是作者身份标记
- 不要编造引用、DOI 或数据来源。原文没有出处就标注缺失,不要补一个
- 不要拿词表当检查清单。词表列的是示例,漏网的永远比列出的多

## 参考文件

- `references/patterns-zh.md` 中文条目全表、实测取值、假阳性防护逐条理由
- `references/patterns-en.md` 英文条目全表,含实测否定的三条规则
- `references/register-business.md` 商务文体:金字塔原理、执行摘要、图表与建议表述
- `references/register-academic.md` 学术文体:IMRaD、CARS、元话语校准、引用可核查性

语料构成、量化依据与已知局限见仓库根目录的研究说明文档。许可与衍生关系见
`LICENSE` 与 `NOTICE.md`。