humanizer-formal · diff
git:20260903.7679471 to git:20260915.1ee7fd5
220 added, 182 removed. Audit A to A.
---
name: humanizer-formal
description: 降低商务与学术文本的 AI 生成感,中英文均适用。Removes AI-writing patterns from business and academic prose, in both Chinese and English. 用于审校已写好的报告、备忘录、论文、摘要、执行摘要,或在起草时预防机器腔。当用户要求「去 AI 味」「让文字更像人写的」「润色成正式书面语」「检查这段像不像 AI 写的」,或提交商务、学术文本请求改写时使用。Use when the user asks to humanize, de-slop, or remove the AI tone from a report, memo, paper, abstract, or executive summary. 不适用于随笔、营销文案、社交媒体、创意写作。Not for essays, marketing copy, social media, or creative writing.
license: MIT. LICENSE has complete terms
---
-
# 商务与学术文本去 AI 感
## 这个 skill 解决什么
- AI 写的商务和学术文本有两类毛病,**成因完全不同,处理方式相反**:
+ AI 写的商务和学术文本有两类毛病,**成因不同,处理方式相反**:
- - **A 类|机器痕迹**:人写不出来的东西。连接词过密、限定语泛滥、"的"字堆叠、
- 破折号乱用。这些**一律要改**。
+ - **A 类|机器痕迹**:人写不出来的东西。连接词过密、限定语泛滥、“的”字堆叠、
+ 破折号乱用、搭配错配。**一律要改**。
- **B 类|语域不符**:人也这么写,但不该出现在你这份文档里。抽象名词、
- buzzword、名词化。这些**按目标语域调整,不是一律删**。
+ buzzword、名词化、比喻、外来语直译。**按目标语域调整,不是一律删**。
- 把两类混为一谈是最常见的错误。实测数据显示,机器翻译的中文里抽象名词密度是
- 全部语料中**最低**的,比教科书还低;而人写的政府白皮书和咨询报告里最高。
- 所以看到「赋能、闭环、生态、体系」就判定是 AI 写的,方向是反的。
+ 混为一谈是最常见的错误。实测显示机器翻译的中文里抽象名词密度是全部语料中
+ **最低**的,比教科书还低,人写的白皮书和咨询报告里最高。所以看到
+ 「赋能、闭环、生态、体系」就判定是 AI 写的,这个判断是错的。
先分类,再动手。
## 第一步:确定目标语域
- 改写前必须知道往哪个方向改。用这把尺子:
+ 分五级:
| 级别 | 中文样例 | 用在哪 |
|---|---|---|
| L1 论文腔/公文腔 | 本研究基于多维指标体系,对目标企业经营绩效进行了系统性实证考察,结果表明其在成本控制维度呈现显著的边际改善态势。 | 期刊投稿、政府公文 |
- | L2 标准学术 | 我们用五项指标评估了该公司的经营绩效。结果显示,其成本控制在样本期内显著改善。 | 学位论文、研究报告 |
- | **L3 默认目标** | **我们用五项指标衡量这家公司的经营情况。2023 到 2025 年,它的单位生产成本从 42 元降到 31 元。** | **商务报告、执行摘要、教科书、面向非专业读者的说明** |
- | L4 口语(禁止) | 我们看了五个指标,这家公司省钱省得挺明显,单位成本从 42 块掉到 31 块。 | — |
- | L5 闲聊(严禁) | 说实话,这公司控成本这块儿真挺猛的,42 到 31,你敢信? | — |
+ | **L2 标准学术与专业商务** | **我们用五项指标评估了该公司的经营绩效。结果显示,其成本控制在样本期内显著改善。** | **学位论文、研究报告、投资备忘录、尽调报告、行业分析、董事会材料** |
+ | L3 通俗说明 | 我们用五项指标衡量这家公司的经营情况。2023 到 2025 年,它的单位生产成本从 42 元降到 31 元。 | 教科书、科普、面向非专业读者的说明、对外宣传 |
+ | L4 口语(禁止) | 我们看了五个指标,这家公司省钱省得挺明显。 | — |
+ | L5 闲聊(严禁) | 说实话,这公司控成本真挺猛的,你敢信? | — |
- 英文同理:
+ 英文同理,L2 `We evaluated the firm's performance on five indicators. Unit
+ production cost fell 26% over the sample period.`
- - L1 `This study undertakes a systematic empirical interrogation of the firm's
- operational performance across a multidimensional indicator framework.`
- - **L3 `We measured the company's performance with five indicators. Between 2023
- and 2025, its unit production cost fell from $42 to $31.`**
- - L5 `Honestly, these guys crushed it on costs — 42 down to 31, wild.`
+ **L3 的判据**:句子短、词常见、结构直白,但**不出现**语气词、人称抒情、
+ 市井词汇、缩略口语、感叹和反问。降级降的是**句法复杂度和抽象名词密度**,
+ 不是降正式度。“更简单”不等于“更随便”,这是本 skill 最容易误解的一点。
- **L3 的判据**:句子短、词常见、结构直白。但**不出现**语气词、人称抒情、
- 市井词汇、缩略口语、感叹和反问。
+ ### 语域适用范围 `设计`
- 降级降的是**句法复杂度和抽象名词密度**,不是降正式度。L3 始终是书面语。
- "更简单"不等于"更随便"。这是本 skill 最容易误解的一点。
+ 没有明确指示时,**输出一律按 L3 为准**:解释、建议、变更清单、可选方案都按
+ L3 写。
- 没有明确指示时默认 L3。用户说"要正式些"就走 L2,说"投期刊"走 L1,
- **永远不要主动降到 L4**。
+ **写正文时按该文档的目标语域执行,未指明目标时取 L2。** 正文指会原样进入
+ 成稿的文字:改写后的段落、句子、标题,以及因平台限制只能直接写在对话里的
+ 文档内容。
+ 判据是去向不是格式:这段文字会不会原样出现在成稿里。会,按目标语域;不会,
+ 按 L3。能用引用块把两者分开时就分开,格式只标记边界。
+
+ **L4 与 L5 在任何情况下禁止**,对话部分同样不出现语气词、缩略口语、感叹
+ 和反问。用户说“要正式些”走 L2,说“投期刊”走 L1。
+
+ ### 术语量按证据密度调 `设计`
+
+ 专业度有两个来源,证据和术语,两者互补。数字密集的段落不需要术语撑专业度,
+ 数字稀薄的段落(理论章节、机制讨论、局限说明)才靠术语维持语域。
+ **有足够数字或出处支撑时,降低术语量。**
+
+ 这一条在目标语域确定之后执行,调的是同一语域内的术语密度,不改变语域级别。
+
## 第二步:按类别处理
- ### A 类规则:机器痕迹,一律改
+ **各条列出的词只是示例,不是完整清单。** 坏搭配、buzzword、外来语直译都列
+ 不完,靠匹配词表只能查出最明显的那几个。判断必须逐句做:看这句话里的每个
+ 动宾搭配、每个定中搭配、每个选词,而不是拿词表去扫。**词表用来提示该往哪
+ 类问题上想,不是用来代替阅读。**
- 每条标注可信度:`实测`=本项目语料验证过;`沿用`=继承上游,未验证。
+ 编号与 `references/patterns-zh.md` 一致。本文件只收最高频的条目,编号因此
+ 不连续。可信度标注:`实测`=本项目语料验证过;`沿用`=继承上游,未验证;
+ `设计`=明确的设计决定,不是测量结论。实测取值与完整例句见
+ `references/patterns-zh.md` 与 `patterns-en.md`。
- ---
+ ### A 类规则:机器痕迹,一律改
**A1 连接词过密** `实测·中文`
中文靠语序和意合衔接,不靠显式连接词。机器把英文的连接词规范整套搬进中文,
还会超量添加。
- 自然频率:大约**每 10 句出现一次**显式连接词
- 危险信号:每 4 到 5 句就出现一次「因此、然而、此外、并且、从而」
- > 改前:该行业需求持续走弱。因此,产能利用率下降。此外,库存周期延长。
- > 并且,价格竞争加剧。从而,行业整体利润率承压。
- >
- > 改后:该行业需求持续走弱,产能利用率下降,库存周期延长。价格竞争加剧,
- > 行业整体利润率承压。
+ > 需求走弱。因此,产能利用率下降。此外,库存周期延长。并且,价格竞争加剧 →
+ > 需求走弱,产能利用率下降,库存周期延长,价格竞争加剧
- 英译中时,原文的连接词**大约要砍掉一半**。
+ 改法是删掉连接词后,靠语序、分句和句号表达逻辑。英译中时原文的连接词
+ **大约要删掉一半**。
---
**A2 无差别限定** `实测·中文`
- 英文学术散文用「may / could / suggest」是常态,中文书面语用得少得多。
- 机器保留英文的限定密度,中文读起来就像什么都不敢说。
+ 英文学术散文用「may / could / suggest」是常态,中文书面语用得少得多。机器
+ 保留英文的限定密度,中文读起来就像什么都不敢说。
- 危险信号:一个段落里出现两个以上「可能、或许、似乎、倾向于」
- 处理原则不是一律删,而是**让限定强度对齐证据强度**:
+ 处理原则不是一律删,而是**让限定强度与证据强度相称**:
- > 改前:数据可能表明,成本或许在一定程度上有所下降,这似乎倾向于说明
- > 管理效率可能有所改善。
- >
- > 改后:单位成本下降 26%。这一变化主要来自能耗改善,管理效率的影响尚无法分离。
+ > 数据可能表明成本或许在一定程度上有所下降,这似乎倾向于说明管理效率
+ > 可能有所改善 → 单位成本下降 26%。这一变化主要来自能耗改善,管理效率的
+ > 影响尚无法分离
- 有把握的直说,没把握的说清楚不确定在哪里,而不是给每句话都套一层软垫。
+ 有把握的直说,没把握的说清楚不确定在哪里,不要对每句话都加限定。
- **注意区分**:「约、左右、近」是**数值近似**,不是认知限定。一份数据密集的
- 报告里出现几十次「约」是精确性的体现,不要删。
+ **注意区分**:「约、左右、近」是**数值近似**,不是认知限定。数据密集的报告里
+ 出现几十次「约」是精确性的体现,不要删。
+ **反向检查**:改完看有没有出现过度确定的句子。绝对化断言(「不是 X」「一律」
+ 「总是」)如果证据只支持多数情况,要把限定语补回去。删限定语和加限定语是
+ 同一条规则的两面,本条不是单向削减。
+
---
**A3 「的」字堆叠与嵌套** `实测·中文`
- 欧化定语直译的产物。英文靠定语从句后置,中文偏好短定语加主谓结构,
- 机器照搬英文语序就会堆出长定语。
+ 欧化定语直译的产物。危险信号:单句 3 个以上「的」,或出现「X 的 Y 的 Z」嵌套。
- - 危险信号:单句出现 3 个以上「的」;出现「X 的 Y 的 Z」嵌套结构
+ > 以获得他们对未来相关性将如何的最佳估计 → 以估计未来的相关性
- > 改前:以获得他们对未来相关性将如何的最佳估计
- > 改后:以估计未来的相关性
+ 改法是**把定语拆成谓语**。定语一长就往后拆成分句,不要堆在名词前面。
- > 改前:对于处于不同风险阶段的金融工具的预期信用损失的计量方法的选择,
- > 需要考虑管理层的判断。
- > 改后:金融工具处于不同风险阶段时,预期信用损失的计量方法也不同,
- > 具体选择由管理层判断。
+ ---
- 改法是**把定语拆成谓语**。定语一长就往后拆成分句,不要在名词前面堆。
+ **A5 「被」字滥用** `实测·中文`
- ---
+ 英文被动直译。中文表被动手段更多,很多情况下根本不需要标记。改法优先级:
+ 改主动 → 用「受、由、经、获」→ 保留「被」(仅在强调受害或确实需要标记时)。
- **A4 「被」字滥用** `实测·中文`
+ ---
- 英文被动直译。中文表被动有更多手段,而且很多情况下根本不需要标记。
+ **A6 轻动词结构** `实测·中文`
- > 改前:该方案被管理层批准后,预算被重新分配到三个被优先考虑的项目。
- > 改后:管理层批准该方案后,预算重新分配到三个优先项目。
+ 「进行、加以、予以、作出」加名词化动词,是翻译腔的典型标记。
- 改法优先级:改主动 → 用「受、由、经、获」→ 保留「被」(仅在强调受害或
- 确实需要标记时)。
+ > 对上述数据进行了系统性的分析 → 分析了上述数据;对结论加以验证 → 验证了结论
---
- **A5 中文破折号** `实测·中文`
-
- 六种人写中文语域实测下来,破折号密度在 0 到 0.16 之间,其中教科书和政府
- 公文是精确的零。机器用它做戏剧性揭示,实测 0.39 到 0.86。
+ **A7 中文破折号** `实测·中文`
- 按 GB/T 15834 中文破折号是全角 `——`,合法用途只有解释说明和话题转换。
- 商务学术正文里**改用逗号、冒号或括号**。
+ 人写中文各语域正文里密度接近零,教科书和政府公文是精确的零。机器用它做
+ 戏剧性揭示。按 GB/T 15834 中文破折号是全角 `——`,合法用途只有解释说明和
+ 话题转换,商务学术正文里**改用逗号、冒号或括号**。
- > 改前:结论很明确——成本控制是唯一可行的路径。
- > 改后:结论很明确:成本控制是唯一可行的路径。
+ > 结论很明确——成本控制是唯一可行的路径 → 结论很明确:成本控制是唯一可行的路径
---
- **A6 「请注意」类祈使句** `实测·中文`
-
- `Note that` 的直译。七组人写中文语料里出现频率**全部为零**,是最接近
- 二值判据的一条。
-
- > 改前:请注意,债券是风险最低的资产。需要注意的是,该结论仅在样本期内成立。
- > 改后:债券是风险最低的资产,但该结论仅在样本期内成立。
+ **A8 「请注意」类祈使句** `实测·中文`
- 「值得注意的是」是合法的中文衔接词,可以保留,但一篇里别超过一两次。
+ `Note that` 的直译。七组人写中文语料里出现频率**全部为零**,是最接近二值
+ 判据的一条。改法是把它承载的转折并进句子。「值得注意的是」是合法的中文
+ 衔接词,可以保留,但一篇里别超过一两次。
---
- **A7 轻动词结构** `实测·中文`
+ **A22 搭配错配** `设计·中文`
- 「进行、加以、予以、作出」加一个名词化动词,是翻译腔的典型标记。
+ 词都对,配对在中文里没有。模型按语义角色组合词,母语写作者按既有说法取用,
+ 两者的产物不一样。这一类是**词表查不出来的**,只能逐句反查。
- > 改前:对上述数据进行了系统性的分析,并对结论加以验证。
- > 改后:分析了上述数据,并验证了结论。
+ **判据一,反查常规宾语。** 拿动词想它最常搭配的三到五个宾语。目标宾语不在
+ 其中、也不属于同一语义类,就是错配。
- ---
+ > 磨 → 刀、墨、豆子。排比不在其中:**磨掉排比** → 拆散排比
+ > 承担 → 责任、费用、风险、后果。语域不在其中:**承担语域** → 维持语域
- **A8 不要磨掉四字格和排比** `实测·中文·反向规则`
+ **判据二,看需不需要辩护。** 要解释这个搭配为什么成立,它就不成立。既有
+ 搭配是取用来的,不需要论证。
- 这是一条**禁止改写**的规则。实测显示人写中文使用三字格和四字格排比的频率
- 是机器翻译的 **2 到 10 倍**。排比是汉语的本土节奏手段,机器不会用。
+ **改法:先说出实际发生了什么,再选那件事的常规动词。**「磨掉排比」里实际
+ 发生的是翻译把排比拆成了散句,那就写「拆成散句」。
- 看到「稳增长、调结构、促创新」这类结构,**不要拆成散句**。
+ 三种形态:动宾错配(磨掉排比、承担语域)、定中生造(深度赋能、全面打通)、
+ 术语跨域挪用(护栏、对齐、降档、跑偏)。第三种与 B1、B5 重叠,按 B 族处理;
+ 前两种归 A 族,一律改。
- 唯一例外:如果四字格是空洞的宣传口号堆砌(「高质量发展、深层次变革、
- 全方位提升」连排且不含具体信息),按 B 类语域问题处理,理由是语域不合,
- 不是因为它像机器写的。
+ **规则名、标题、清单项优先受检。** 它们会被复制到别处,一处错误会变成多处。
---
- **A9 名词化与虚位主语** `沿用·英文`
+ **英文侧:名词化与虚位主语** `沿用·英文`
英文侧未经本项目语料验证,按上游规则执行。
- - 弱动词加名词化:`conduct an analysis` → `analyze`
- - 虚位主语:`There is a need to reduce costs` → `Costs must fall`
- - of 链:`the improvement of the efficiency of the process` → `process efficiency gains`
+ - `conduct an analysis` → `analyze`
+ - `There is a need to reduce costs` → `Costs must fall`
+ - `the improvement of the efficiency of the process` → `process efficiency gains`
方法学章节的被动语态是合法的,不要一律改主动。
---
- **A10 聊天残留与元评论** `沿用·中英`
+ **中英通用:聊天残留与元评论** `沿用·中英`
- - 删掉「希望这对你有帮助」「以下是……」「让我为你分析一下」
- - 删掉知识截止声明、能力免责
- - 删掉「作为一个 AI」类自我指称
- - 正文里不出现表情符号,商务学术场合零容忍
+ 删掉「希望这对你有帮助」「以下是……」「让我为你分析一下」、知识截止声明、
+ 能力免责、「作为一个 AI」类自我指称。正文里不出现表情符号,商务学术场合
+ 零容忍。
---
- ### B 类规则:语域不符,按目标调整
+ **D1 不要拆散四字格和排比** `实测·中文·反向规则`
- B 类的判据是**这份文档该用多少**,不是"超过多少就是 AI"。
+ 这一条**禁止改写**,放在这里是因为它最容易被 A 族规则误伤。实测显示人写
+ 中文使用三字格和四字格排比的频率是机器翻译的 **2 到 10 倍**。排比是汉语的
+ 本土节奏手段,机器不会用。看到「稳增长、调结构、促创新」这类结构,
+ **不要拆成散句**。
- 实测的语域阶梯(抽象名词密度,从低到高):
+ 唯一例外:空洞的宣传口号连排(「高质量发展、深层次变革、全方位提升」且不含
+ 具体信息)按 B 类处理,理由是语域不合,不是像机器写的。
+ ---
+
+ ### B 类规则:语域不符,按目标调整
+
+ 判据是**这份文档该用多少**,不是“超过多少就是 AI”。实测的抽象名词阶梯:
+
```
英文 教科书 < 10-K < 联合国文件 < 政府白皮书
中文 教科书 < 年报 < 央行报告 < 白皮书 < 咨询研究报告
```
- **B1 抽象名词与 buzzword**
+ **B1 抽象名词与 buzzword** `实测·中英`
中文:赋能、闭环、抓手、生态、护城河、飞轮、颗粒度、打通、对齐、组合拳
英文:landscape、ecosystem、paradigm、synergy、holistic、leverage、framework
判断方法:**删掉这个词,句子的信息量有变化吗?** 没有就删。
- > 改前:通过数字化赋能打通产业链堵点,构建全方位的产业生态闭环。
- > 改后:把订单数据接入供应商系统,把交货周期从 21 天压到 9 天。
+ > 通过数字化赋能打通产业链堵点,构建全方位的产业生态闭环 →
+ > 把订单数据接入供应商系统,交货周期从 21 天压缩到 9 天
- **B2 增强语堆砌**
+ 「体系、机制」在央行与政策文本里有确切所指,不要一律删。判据始终是有无所指。
+ **B2 增强语堆砌** `实测·中英`
+
中文:至关重要、显著、全面、深入、有力、高质量、切实、大力
英文:significant、crucial、essential、critical、robust、comprehensive
- 同样问题:这些词不提供信息,只提供语气。有数据就给数据。
+ 这些词不提供信息,只提供语气。有数据就给数据。
- **B3 目标语域对照**
+ **B3 名词化后缀堆叠** `实测·中文`
- - 写**执行摘要、投资备忘录、尽调报告**:对标 10-K,抽象名词压到最低,
- 结论前置,每个判断挂数据
- - 写**学术论文**:对标教科书与专著,允许适度名词化,限定语按证据强度校准
- - 写**政策建议、白皮书**:抽象名词密度天然较高,但仍要求每个概念后面有落地内容
+ 「性、化、度、率、力、感」。实测无区分度,人写区间完全覆盖机器区间,
+ 所以只是语域标记,不作机器痕迹判据。
+ **B4 比喻的使用** `设计·中英`
+
+ **说明性类比**:用熟悉的事物解释陌生机制,本体与喻体都点明,带显式标记
+ (相当于、类似于、可以看作)。判据是删掉它读者还能不能理解这个机制,不能
+ 就保留。约束按局部算,不按篇幅算:一个机制一个类比,同段不超过一处,
+ 相邻两段不连续。全文无上限。**该给却不给,同样是缺陷。**
+
+ **修辞性比喻**:本体已说清,比喻只添色彩,一律改直陈。三种形态:暗喻、
+ 抽象操作物理化(挂数据、砍掉、打通、闭环、抓手)、拟人(数据告诉我们)。
+ 判据同 B1。
+
+ > 整套规则挂在一把五级标尺上 → 规则分五级
+
+ **方向性词语**:「方向相反、反过来、搞错了方向」是空间比喻,机器用得远多于
+ 人。判据是**能不能指出那条轴**:说得出哪个量沿哪个方向变化、不等号怎么翻转,
+ 保留;说不出,按实际关系改写成「冲突」「错误」「不同」。反向要求按 A2
+ 校准:真有方向翻转却写成「不同」,是信息损失。
+
+ 警句式比喻(「数据是新时代的石油」)是本条的极端形态,见 A17。
+
+ **B5 优先使用中文固有词** `设计·中文`
+
+ 材料与用户都没有指定术语时,选词优先用中文固有说法,不用外来语直译。
+
+ **判据:这个词是不是某个英文词的直译,而中文里本来另有说法。** 下面的对照
+ 只是示例,不是清单,直译词列不完。
+
+ > 基线 → 标准;场景 → 情况;维度 → 方面;复用 → 重复使用;对标 → 参照;
+ > 落地 → 实施;触达 → 送达;链路 → 环节;护栏 → 例外、限制
+
+ 两条例外。一、**本领域中文文献通用的术语不算**:语域、名词化、分位数、
+ 变异系数都是借来的或新造的,但它们是各自领域的通用说法,换掉反而看不懂。
+ 二、**没有自然的替换就保留**,不要硬造。
+
+ 这条换的是词的来源,不是层级。标准和基线一样专业。材料里已出现的术语按
+ D2 一字不变地复现。
+
+ ### 按目标语域取值
+
+ - **执行摘要、投资备忘录、尽调报告**:参照 10-K,抽象名词降到最低,结论
+ 前置,每个判断给出数据
+ - **学术论文**:参照教科书与专著,允许适度名词化,限定语与证据强度相称
+ - **政策建议、白皮书**:抽象名词密度天然较高,但仍要求每个概念后面有具体做法
+
## 判定纪律
### 共现才算证据
- **单个指标不构成判定依据。** 本项目的实测数据支持这条原则:几乎每个指标的
- 人写区间和机器区间都相邻,有些直接重叠。中文侧的连接词和认知限定是少数
- 无重叠的例外,其余全部需要组合判断。
-
- - 一个破折号什么都不说明
- - 一次「此外」什么都不说明
- - 一个弯引号什么都不说明
- - 同一段里出现三四种痕迹,才是证据
+ **单个指标不构成判定依据。** 几乎每个指标的人写区间和机器区间都相邻,有些
+ 直接重叠。中文侧的连接词和认知限定是少数无重叠的例外。
- 不确定时,找更多痕迹,不要靠单条下判断。
+ 一个破折号、一次「此外」、一个弯引号都说明不了任何事。**同一段出现两处以上
+ 不同痕迹才是修改信号,超过两处已经影响阅读观感。** 注意是**不同**痕迹共现,
+ 不是同一痕迹反复出现。
### 不要误判为 AI 的东西
- 以下特征单独出现时**不是** AI 痕迹,不要因为它们而改写:
+ 以下特征单独出现时**不是** AI 痕迹:文字干净风格统一、正式或学术词汇、
+ 孤立的连接词、弯引号与全角标点、单个破折号、单个短句、没有引用、规范的
+ 复杂排版、引文与标题内部的敏感词、合理的免责与范围声明、读者真会考虑的
+ 备选方案。
- - **文字干净、风格统一。** 很多人是专业写作者或经过编辑。工整不等于机器写的。
- - **正式或学术词汇。** B 族列的是特定的过度使用词,不是让你把所有正式词
- 改成大白话。
- - **孤立的连接词。** 「此外」「因此」只有在堆叠时才是痕迹。
- - **弯引号、全角标点。** 输入法和编辑器默认就这么处理。
- - **单个破折号。** 英文侧实测显示同类人写文本的破折号密度差 20 倍以上,
- 这是个人习惯。
- - **单个短句。** 只有连续多个戏剧性短句才是痕迹。
- - **没有引用。** 大量正常文本不带引用,缺引用不证明任何事。
- - **规范的复杂排版。** 模板和可视化编辑器就能产出干净格式。
- - **引文、标题、专有名词里的"敏感词"。** 被讨论的词和被使用的词不一样,
- 不要改动引文内部。
- - **合理的免责与范围声明。** 法律提示、安全提示、口径说明、真实的更正、
- 指名的反驳,全部保留。
- - **真实的备选方案。** 设计文档和论证里读者会考虑的选项要留下。
+ 最容易误伤的三处:**引文内部不改**,被讨论的词和被使用的词不一样;**法律
+ 与安全提示不删**,那是责任要求;**设计文档里的备选方案不删**。逐条理由见
+ `patterns-zh.md` 的假阳性防护一节。
### 要保留的人写痕迹
- 这些细节承载作者的声音,除非损害准确性,一律保留:
-
- - **具体而不寻常的细节。** 一个真实的门牌号、一句奇怪的引语、一个只有
- 当事人会写出来的限定条件。
- - **未解决的张力。** 「这个结论我大致相信,但有一点始终解释不通」这类
- 表述比强行下结论更可信。
- - **句长的自然起伏。** 真实写作长短交替,机器倾向于中等长度的均匀节奏。
- - **真实的自我修正与插入语。** 作者中途改口、补充限定,机器很少这样。
- - **有据可依的第一人称选择。** 作者能说清为什么这么写的,就别动。
+ 除非损害准确性一律保留:具体而不寻常的细节、未解决的张力(「这个结论我
+ 大致相信,但有一点始终解释不通」)、句长的自然起伏、真实的自我修正与
+ 插入语、有据可依的第一人称选择。
## 第三步:两种使用模式
### 审校模式(默认)
- 1. 判定目标语域(默认 L3)
- 2. 通读一遍,标出 A 类问题;确认痕迹是否共现,不要单条定罪
- 3. 改 A 类
+ 1. 判定目标语域(正文默认 L2,对话按 L3)
+ 2. **逐句读一遍**,标出 A 类问题。这一步有两种检查,都要做:一是词表提示的
+ 那几类(连接词、限定语、「的」、「被」、轻动词、破折号),二是词表查不到
+ 的搭配问题(A22),后者要逐句取出动宾对和定中对反查常规搭配。
+ **不要用词表代替阅读。**
+ 3. 确认痕迹是否共现,不要凭单条下判断,再改 A 类
4. 对照目标语域检查 B 类,按需调整
- 5. **改完自查两个问题**:
- - 还有哪里读着像机器写的?
- - **改写有没有增加或删除任何事实、名称、数字、日期、引语、引用、
- 排序或其他主张?** 任何无依据的新增或丢失的内容都算错误,必须回退。
+ 5. **改完自查两个问题**:还有哪里读着像机器写的?**改写有没有增加或删除
+ 任何事实、名称、数字、日期、引语、引用、排序或其他主张?** 任何无依据的
+ 新增或丢失都算错误,必须回退。
6. 输出
第 5 步的第二问是硬性的。去 AI 味的过程中丢掉一个数字,比留着 AI 味严重得多。
### 起草模式
- 写之前先定语域,然后:
-
- - 结论前置,不要背景铺垫开场
- - 每个判断后面跟数据、出处或明确的不确定性说明
- - 想写抽象名词时,先问能不能换成具体动作
- - 连接词能省就省
- - 写完自查 A1、A2、A6 三条,这三条最容易犯
+ 写之前先定语域,然后结论前置,不要背景铺垫开场;每个判断后面跟数据、出处
+ 或明确的不确定性说明;想写抽象名词时先问能不能换成具体动作;连接词能省
+ 就省;**动宾与定中搭配取汉语里既有的说法,不按语义拼合新的**。写完自查
+ A1、A2、A8、A22 四条,这四条最容易犯。
## 输出形态
- 按调用方式区分,不要一律给同一种输出。
-
- **粘贴文本(默认)** 给改写稿 + 变更清单。变更清单每条注明命中的规则编号
- 和理由。商务场合改稿常要向上解释依据。
+ **粘贴文本(默认)** 改写稿放进引用块按目标语域;变更清单在块外按 L3,
+ 每条注明命中的规则编号和理由。商务场合改稿常要向上解释依据。
- **指定文件** 跑完整流程,但只把最终文本写进文件,然后给一句话摘要。
- **只改散文部分**:代码块、YAML、数据表、链接地址、公式一律不动。
+ **指定文件** 跑完整流程,只把最终文本写进文件,然后给一句话摘要,摘要
+ 留在对话里按 L3。**只改散体文字**:代码块、YAML、数据表、链接地址、公式
+ 一律不动。
- **其他任务调用时** 只返回最终文本,不要附带清单和说明。
+ **其他任务调用时** 只返回最终文本,不附清单和说明。
## 绝不做的事
- - 不要为了"像人写的"注入个人情绪、幽默、锋芒或第一人称抒情。
- 商务学术语境里这会直接损害可信度。
- - 不要把语域降到 L4 以下。简单不等于随便。
- - 不要改动数字、单位、口径、专有名词和术语。
- **术语必须一字不变地复现**,「用户留存率」不能中途变成「客户黏性」。
- - 不要删除有证据支撑的限定语。学术写作里恰当的 hedging 是义务,
- 10-K 风险因素章节的限定语是法律要求。
- - 不要凭 buzzword 密度判定文本是 AI 写的。这是语域标记,不是作者身份标记。
- - 不要编造引用、DOI 或数据来源。原文没有出处就标注缺失,不要补一个。
+ - 不要为了“像人写的”注入个人情绪、幽默、锋芒或第一人称抒情,商务学术
+ 语境里这会直接损害可信度
+ - 不要把语域降到 L4 以下,正文与对话都一样
+ - 不要改动数字、单位、口径、专有名词,以及**材料里的术语**。材料里的术语
+ 必须一字不变地复现。改写中自己新造的说法不在此列,同样要过 A22
+ - 不要删除有证据支撑的限定语。10-K 风险因素章节的限定语是法律要求
+ - 不要凭 buzzword 密度判定文本是 AI 写的,那是语域标记不是作者身份标记
+ - 不要编造引用、DOI 或数据来源。原文没有出处就标注缺失,不要补一个
+ - 不要拿词表当检查清单。词表列的是示例,漏网的永远比列出的多
## 参考文件
- 需要更细的规则和实测依据时查阅:
-
- - `references/patterns-zh.md` 中文专属条目全表与更多示例
- - `references/patterns-en.md` 英文专属条目全表,含实测否定的三条规则
+ - `references/patterns-zh.md` 中文条目全表、实测取值、假阳性防护逐条理由
+ - `references/patterns-en.md` 英文条目全表,含实测否定的三条规则
- `references/register-business.md` 商务文体:金字塔原理、执行摘要、图表与建议表述
- `references/register-academic.md` 学术文体:IMRaD、CARS、元话语校准、引用可核查性
- 规则背后的语料构成、量化依据与已知局限,见仓库根目录的研究说明文档。
-
- 许可与衍生关系见 `LICENSE` 与 `NOTICE.md`。
+ 语料构成、量化依据与已知局限见仓库根目录的研究说明文档。许可与衍生关系见
+ `LICENSE` 与 `NOTICE.md`。