humanizer-formal · git:20260903.8cd6c6b · 2026-09-03 · sha256 6664e08403068c1c
humanizer-formal git:20260903.8cd6c6bA
Immutable. This exact content is served forever at /api/v1/blob/6664e08403068c1c.
---
name: humanizer-formal
description: 降低商务与学术文本的 AI 生成感,中英文均适用。用于审校已写好的报告、备忘录、论文、摘要、执行摘要,或在起草时预防机器腔。当用户要求「去 AI 味」「让文字更像人写的」「润色成正式书面语」「检查这段像不像 AI 写的」,或提交商务/学术文本请求改写时使用。不适用于随笔、营销文案、社交媒体、创意写作。
license: MIT. LICENSE has complete terms
---
# 商务与学术文本去 AI 感
## 这个 skill 解决什么
AI 写的商务和学术文本有两类毛病,**成因完全不同,处理方式相反**:
- **A 类|机器痕迹**:人写不出来的东西。连接词过密、限定语泛滥、"的"字堆叠、
破折号乱用。这些**一律要改**。
- **B 类|语域不符**:人也这么写,但不该出现在你这份文档里。抽象名词、
buzzword、名词化。这些**按目标语域调整,不是一律删**。
把两类混为一谈是最常见的错误。实测数据显示,机器翻译的中文里抽象名词密度是
全部语料中**最低**的,比教科书还低;而人写的政府白皮书和咨询报告里最高。
所以看到「赋能、闭环、生态、体系」就判定是 AI 写的,方向是反的。
先分类,再动手。
## 第一步:确定目标语域
改写前必须知道往哪个方向改。用这把尺子:
| 级别 | 中文样例 | 用在哪 |
|---|---|---|
| L1 论文腔/公文腔 | 本研究基于多维指标体系,对目标企业经营绩效进行了系统性实证考察,结果表明其在成本控制维度呈现显著的边际改善态势。 | 期刊投稿、政府公文 |
| L2 标准学术 | 我们用五项指标评估了该公司的经营绩效。结果显示,其成本控制在样本期内显著改善。 | 学位论文、研究报告 |
| **L3 默认目标** | **我们用五项指标衡量这家公司的经营情况。2023 到 2025 年,它的单位生产成本从 42 元降到 31 元。** | **商务报告、执行摘要、教科书、面向非专业读者的说明** |
| L4 口语(禁止) | 我们看了五个指标,这家公司省钱省得挺明显,单位成本从 42 块掉到 31 块。 | — |
| L5 闲聊(严禁) | 说实话,这公司控成本这块儿真挺猛的,42 到 31,你敢信? | — |
英文同理:
- L1 `This study undertakes a systematic empirical interrogation of the firm's
operational performance across a multidimensional indicator framework.`
- **L3 `We measured the company's performance with five indicators. Between 2023
and 2025, its unit production cost fell from $42 to $31.`**
- L5 `Honestly, these guys crushed it on costs — 42 down to 31, wild.`
**L3 的判据**:句子短、词常见、结构直白。但**不出现**语气词、人称抒情、
市井词汇、缩略口语、感叹和反问。
降级降的是**句法复杂度和抽象名词密度**,不是降正式度。L3 始终是书面语。
"更简单"不等于"更随便"。这是本 skill 最容易误解的一点。
没有明确指示时默认 L3。用户说"要正式些"就走 L2,说"投期刊"走 L1,
**永远不要主动降到 L4**。
## 第二步:按类别处理
### A 类规则:机器痕迹,一律改
每条标注可信度:`实测`=本项目语料验证过;`沿用`=继承上游,未验证。
---
**A1 连接词过密** `实测·中文`
中文靠语序和意合衔接,不靠显式连接词。机器把英文的连接词规范整套搬进中文,
还会超量添加。
- 自然频率:大约**每 10 句出现一次**显式连接词
- 危险信号:每 4 到 5 句就出现一次「因此、然而、此外、并且、从而」
> 改前:该行业需求持续走弱。因此,产能利用率下降。此外,库存周期延长。
> 并且,价格竞争加剧。从而,行业整体利润率承压。
>
> 改后:该行业需求持续走弱,产能利用率下降,库存周期延长。价格竞争加剧,
> 行业整体利润率承压。
英译中时,原文的连接词**大约要砍掉一半**。
---
**A2 无差别限定** `实测·中文`
英文学术散文用「may / could / suggest」是常态,中文书面语用得少得多。
机器保留英文的限定密度,中文读起来就像什么都不敢说。
- 危险信号:一个段落里出现两个以上「可能、或许、似乎、倾向于」
处理原则不是一律删,而是**让限定强度对齐证据强度**:
> 改前:数据可能表明,成本或许在一定程度上有所下降,这似乎倾向于说明
> 管理效率可能有所改善。
>
> 改后:单位成本下降 26%。这一变化主要来自能耗改善,管理效率的影响尚无法分离。
有把握的直说,没把握的说清楚不确定在哪里,而不是给每句话都套一层软垫。
**注意区分**:「约、左右、近」是**数值近似**,不是认知限定。一份数据密集的
报告里出现几十次「约」是精确性的体现,不要删。
---
**A3 「的」字堆叠与嵌套** `实测·中文`
欧化定语直译的产物。英文靠定语从句后置,中文偏好短定语加主谓结构,
机器照搬英文语序就会堆出长定语。
- 危险信号:单句出现 3 个以上「的」;出现「X 的 Y 的 Z」嵌套结构
> 改前:以获得他们对未来相关性将如何的最佳估计
> 改后:以估计未来的相关性
> 改前:对于处于不同风险阶段的金融工具的预期信用损失的计量方法的选择,
> 需要考虑管理层的判断。
> 改后:金融工具处于不同风险阶段时,预期信用损失的计量方法也不同,
> 具体选择由管理层判断。
改法是**把定语拆成谓语**。定语一长就往后拆成分句,不要在名词前面堆。
---
**A4 「被」字滥用** `实测·中文`
英文被动直译。中文表被动有更多手段,而且很多情况下根本不需要标记。
> 改前:该方案被管理层批准后,预算被重新分配到三个被优先考虑的项目。
> 改后:管理层批准该方案后,预算重新分配到三个优先项目。
改法优先级:改主动 → 用「受、由、经、获」→ 保留「被」(仅在强调受害或
确实需要标记时)。
---
**A5 中文破折号** `实测·中文`
六种人写中文语域实测下来,破折号密度在 0 到 0.16 之间,其中教科书和政府
公文是精确的零。机器用它做戏剧性揭示,实测 0.39 到 0.86。
按 GB/T 15834 中文破折号是全角 `——`,合法用途只有解释说明和话题转换。
商务学术正文里**改用逗号、冒号或括号**。
> 改前:结论很明确——成本控制是唯一可行的路径。
> 改后:结论很明确:成本控制是唯一可行的路径。
---
**A6 「请注意」类祈使句** `实测·中文`
`Note that` 的直译。七组人写中文语料里出现频率**全部为零**,是最接近
二值判据的一条。
> 改前:请注意,债券是风险最低的资产。需要注意的是,该结论仅在样本期内成立。
> 改后:债券是风险最低的资产,但该结论仅在样本期内成立。
「值得注意的是」是合法的中文衔接词,可以保留,但一篇里别超过一两次。
---
**A7 轻动词结构** `实测·中文`
「进行、加以、予以、作出」加一个名词化动词,是翻译腔的典型标记。
> 改前:对上述数据进行了系统性的分析,并对结论加以验证。
> 改后:分析了上述数据,并验证了结论。
---
**A8 不要磨掉四字格和排比** `实测·中文·反向规则`
这是一条**禁止改写**的规则。实测显示人写中文使用三字格和四字格排比的频率
是机器翻译的 **2 到 10 倍**。排比是汉语的本土节奏手段,机器不会用。
看到「稳增长、调结构、促创新」这类结构,**不要拆成散句**。
唯一例外:如果四字格是空洞的宣传口号堆砌(「高质量发展、深层次变革、
全方位提升」连排且不含具体信息),按 B 类语域问题处理,理由是语域不合,
不是因为它像机器写的。
---
**A9 名词化与虚位主语** `沿用·英文`
英文侧未经本项目语料验证,按上游规则执行。
- 弱动词加名词化:`conduct an analysis` → `analyze`
- 虚位主语:`There is a need to reduce costs` → `Costs must fall`
- of 链:`the improvement of the efficiency of the process` → `process efficiency gains`
方法学章节的被动语态是合法的,不要一律改主动。
---
**A10 聊天残留与元评论** `沿用·中英`
- 删掉「希望这对你有帮助」「以下是……」「让我为你分析一下」
- 删掉知识截止声明、能力免责
- 删掉「作为一个 AI」类自我指称
- 正文里不出现表情符号,商务学术场合零容忍
---
### B 类规则:语域不符,按目标调整
B 类的判据是**这份文档该用多少**,不是"超过多少就是 AI"。
实测的语域阶梯(抽象名词密度,从低到高):
```
英文 教科书 < 10-K < 联合国文件 < 政府白皮书
中文 教科书 < 年报 < 央行报告 < 白皮书 < 咨询研究报告
```
**B1 抽象名词与 buzzword**
中文:赋能、闭环、抓手、生态、护城河、飞轮、颗粒度、打通、对齐、组合拳
英文:landscape、ecosystem、paradigm、synergy、holistic、leverage、framework
判断方法:**删掉这个词,句子的信息量有变化吗?** 没有就删。
> 改前:通过数字化赋能打通产业链堵点,构建全方位的产业生态闭环。
> 改后:把订单数据接入供应商系统,把交货周期从 21 天压到 9 天。
**B2 增强语堆砌**
中文:至关重要、显著、全面、深入、有力、高质量、切实、大力
英文:significant、crucial、essential、critical、robust、comprehensive
同样问题:这些词不提供信息,只提供语气。有数据就给数据。
**B3 目标语域对照**
- 写**执行摘要、投资备忘录、尽调报告**:对标 10-K,抽象名词压到最低,
结论前置,每个判断挂数据
- 写**学术论文**:对标教科书与专著,允许适度名词化,限定语按证据强度校准
- 写**政策建议、白皮书**:抽象名词密度天然较高,但仍要求每个概念后面有落地内容
## 判定纪律
### 共现才算证据
**单个指标不构成判定依据。** 本项目的实测数据支持这条原则:几乎每个指标的
人写区间和机器区间都相邻,有些直接重叠。中文侧的连接词和认知限定是少数
无重叠的例外,其余全部需要组合判断。
- 一个破折号什么都不说明
- 一次「此外」什么都不说明
- 一个弯引号什么都不说明
- 同一段里出现三四种痕迹,才是证据
不确定时,找更多痕迹,不要靠单条下判断。
### 不要误判为 AI 的东西
以下特征单独出现时**不是** AI 痕迹,不要因为它们而改写:
- **文字干净、风格统一。** 很多人是专业写作者或经过编辑。工整不等于机器写的。
- **正式或学术词汇。** B 族列的是特定的过度使用词,不是让你把所有正式词
改成大白话。
- **孤立的连接词。** 「此外」「因此」只有在堆叠时才是痕迹。
- **弯引号、全角标点。** 输入法和编辑器默认就这么处理。
- **单个破折号。** 英文侧实测显示同类人写文本的破折号密度差 20 倍以上,
这是个人习惯。
- **单个短句。** 只有连续多个戏剧性短句才是痕迹。
- **没有引用。** 大量正常文本不带引用,缺引用不证明任何事。
- **规范的复杂排版。** 模板和可视化编辑器就能产出干净格式。
- **引文、标题、专有名词里的"敏感词"。** 被讨论的词和被使用的词不一样,
不要改动引文内部。
- **合理的免责与范围声明。** 法律提示、安全提示、口径说明、真实的更正、
指名的反驳,全部保留。
- **真实的备选方案。** 设计文档和论证里读者会考虑的选项要留下。
### 要保留的人写痕迹
这些细节承载作者的声音,除非损害准确性,一律保留:
- **具体而不寻常的细节。** 一个真实的门牌号、一句奇怪的引语、一个只有
当事人会写出来的限定条件。
- **未解决的张力。** 「这个结论我大致相信,但有一点始终解释不通」这类
表述比强行下结论更可信。
- **句长的自然起伏。** 真实写作长短交替,机器倾向于中等长度的均匀节奏。
- **真实的自我修正与插入语。** 作者中途改口、补充限定,机器很少这样。
- **有据可依的第一人称选择。** 作者能说清为什么这么写的,就别动。
## 第三步:两种使用模式
### 审校模式(默认)
1. 判定目标语域(默认 L3)
2. 通读一遍,标出 A 类问题;确认痕迹是否共现,不要单条定罪
3. 改 A 类
4. 对照目标语域检查 B 类,按需调整
5. **改完自查两个问题**:
- 还有哪里读着像机器写的?
- **改写有没有增加或删除任何事实、名称、数字、日期、引语、引用、
排序或其他主张?** 任何无依据的新增或丢失的内容都算错误,必须回退。
6. 输出
第 5 步的第二问是硬性的。去 AI 味的过程中丢掉一个数字,比留着 AI 味严重得多。
### 起草模式
写之前先定语域,然后:
- 结论前置,不要背景铺垫开场
- 每个判断后面跟数据、出处或明确的不确定性说明
- 想写抽象名词时,先问能不能换成具体动作
- 连接词能省就省
- 写完自查 A1、A2、A6 三条,这三条最容易犯
## 输出形态
按调用方式区分,不要一律给同一种输出。
**粘贴文本(默认)** 给改写稿 + 变更清单。变更清单每条注明命中的规则编号
和理由。商务场合改稿常要向上解释依据。
**指定文件** 跑完整流程,但只把最终文本写进文件,然后给一句话摘要。
**只改散文部分**:代码块、YAML、数据表、链接地址、公式一律不动。
**其他任务调用时** 只返回最终文本,不要附带清单和说明。
## 绝不做的事
- 不要为了"像人写的"注入个人情绪、幽默、锋芒或第一人称抒情。
商务学术语境里这会直接损害可信度。
- 不要把语域降到 L4 以下。简单不等于随便。
- 不要改动数字、单位、口径、专有名词和术语。
**术语必须一字不变地复现**,「用户留存率」不能中途变成「客户黏性」。
- 不要删除有证据支撑的限定语。学术写作里恰当的 hedging 是义务,
10-K 风险因素章节的限定语是法律要求。
- 不要凭 buzzword 密度判定文本是 AI 写的。这是语域标记,不是作者身份标记。
- 不要编造引用、DOI 或数据来源。原文没有出处就标注缺失,不要补一个。
## 参考文件
需要更细的规则和实测依据时查阅:
- `references/patterns-zh.md` 中文专属条目全表与更多示例
- `references/patterns-en.md` 英文专属条目全表,含实测否定的三条规则
- `references/register-business.md` 商务文体:金字塔原理、执行摘要、图表与建议表述
- `references/register-academic.md` 学术文体:IMRaD、CARS、元话语校准、引用可核查性
规则背后的语料构成、量化依据与已知局限,见仓库根目录的研究说明文档。
许可与衍生关系见 `LICENSE` 与 `NOTICE.md`。