humanizer-formal · git:20260915.1ee7fd5 · 2026-09-15 · sha256 d3781a54f78d14eb
humanizer-formal git:20260915.1ee7fd5A
Immutable. This exact content is served forever at /api/v1/blob/d3781a54f78d14eb.
--- name: humanizer-formal description: 降低商务与学术文本的 AI 生成感,中英文均适用。Removes AI-writing patterns from business and academic prose, in both Chinese and English. 用于审校已写好的报告、备忘录、论文、摘要、执行摘要,或在起草时预防机器腔。当用户要求「去 AI 味」「让文字更像人写的」「润色成正式书面语」「检查这段像不像 AI 写的」,或提交商务、学术文本请求改写时使用。Use when the user asks to humanize, de-slop, or remove the AI tone from a report, memo, paper, abstract, or executive summary. 不适用于随笔、营销文案、社交媒体、创意写作。Not for essays, marketing copy, social media, or creative writing. license: MIT. LICENSE has complete terms --- # 商务与学术文本去 AI 感 ## 这个 skill 解决什么 AI 写的商务和学术文本有两类毛病,**成因不同,处理方式相反**: - **A 类|机器痕迹**:人写不出来的东西。连接词过密、限定语泛滥、“的”字堆叠、 破折号乱用、搭配错配。**一律要改**。 - **B 类|语域不符**:人也这么写,但不该出现在你这份文档里。抽象名词、 buzzword、名词化、比喻、外来语直译。**按目标语域调整,不是一律删**。 混为一谈是最常见的错误。实测显示机器翻译的中文里抽象名词密度是全部语料中 **最低**的,比教科书还低,人写的白皮书和咨询报告里最高。所以看到 「赋能、闭环、生态、体系」就判定是 AI 写的,这个判断是错的。 先分类,再动手。 ## 第一步:确定目标语域 分五级: | 级别 | 中文样例 | 用在哪 | |---|---|---| | L1 论文腔/公文腔 | 本研究基于多维指标体系,对目标企业经营绩效进行了系统性实证考察,结果表明其在成本控制维度呈现显著的边际改善态势。 | 期刊投稿、政府公文 | | **L2 标准学术与专业商务** | **我们用五项指标评估了该公司的经营绩效。结果显示,其成本控制在样本期内显著改善。** | **学位论文、研究报告、投资备忘录、尽调报告、行业分析、董事会材料** | | L3 通俗说明 | 我们用五项指标衡量这家公司的经营情况。2023 到 2025 年,它的单位生产成本从 42 元降到 31 元。 | 教科书、科普、面向非专业读者的说明、对外宣传 | | L4 口语(禁止) | 我们看了五个指标,这家公司省钱省得挺明显。 | — | | L5 闲聊(严禁) | 说实话,这公司控成本真挺猛的,你敢信? | — | 英文同理,L2 `We evaluated the firm's performance on five indicators. Unit production cost fell 26% over the sample period.` **L3 的判据**:句子短、词常见、结构直白,但**不出现**语气词、人称抒情、 市井词汇、缩略口语、感叹和反问。降级降的是**句法复杂度和抽象名词密度**, 不是降正式度。“更简单”不等于“更随便”,这是本 skill 最容易误解的一点。 ### 语域适用范围 `设计` 没有明确指示时,**输出一律按 L3 为准**:解释、建议、变更清单、可选方案都按 L3 写。 **写正文时按该文档的目标语域执行,未指明目标时取 L2。** 正文指会原样进入 成稿的文字:改写后的段落、句子、标题,以及因平台限制只能直接写在对话里的 文档内容。 判据是去向不是格式:这段文字会不会原样出现在成稿里。会,按目标语域;不会, 按 L3。能用引用块把两者分开时就分开,格式只标记边界。 **L4 与 L5 在任何情况下禁止**,对话部分同样不出现语气词、缩略口语、感叹 和反问。用户说“要正式些”走 L2,说“投期刊”走 L1。 ### 术语量按证据密度调 `设计` 专业度有两个来源,证据和术语,两者互补。数字密集的段落不需要术语撑专业度, 数字稀薄的段落(理论章节、机制讨论、局限说明)才靠术语维持语域。 **有足够数字或出处支撑时,降低术语量。** 这一条在目标语域确定之后执行,调的是同一语域内的术语密度,不改变语域级别。 ## 第二步:按类别处理 **各条列出的词只是示例,不是完整清单。** 坏搭配、buzzword、外来语直译都列 不完,靠匹配词表只能查出最明显的那几个。判断必须逐句做:看这句话里的每个 动宾搭配、每个定中搭配、每个选词,而不是拿词表去扫。**词表用来提示该往哪 类问题上想,不是用来代替阅读。** 编号与 `references/patterns-zh.md` 一致。本文件只收最高频的条目,编号因此 不连续。可信度标注:`实测`=本项目语料验证过;`沿用`=继承上游,未验证; `设计`=明确的设计决定,不是测量结论。实测取值与完整例句见 `references/patterns-zh.md` 与 `patterns-en.md`。 ### A 类规则:机器痕迹,一律改 **A1 连接词过密** `实测·中文` 中文靠语序和意合衔接,不靠显式连接词。机器把英文的连接词规范整套搬进中文, 还会超量添加。 - 自然频率:大约**每 10 句出现一次**显式连接词 - 危险信号:每 4 到 5 句就出现一次「因此、然而、此外、并且、从而」 > 需求走弱。因此,产能利用率下降。此外,库存周期延长。并且,价格竞争加剧 → > 需求走弱,产能利用率下降,库存周期延长,价格竞争加剧 改法是删掉连接词后,靠语序、分句和句号表达逻辑。英译中时原文的连接词 **大约要删掉一半**。 --- **A2 无差别限定** `实测·中文` 英文学术散文用「may / could / suggest」是常态,中文书面语用得少得多。机器 保留英文的限定密度,中文读起来就像什么都不敢说。 - 危险信号:一个段落里出现两个以上「可能、或许、似乎、倾向于」 处理原则不是一律删,而是**让限定强度与证据强度相称**: > 数据可能表明成本或许在一定程度上有所下降,这似乎倾向于说明管理效率 > 可能有所改善 → 单位成本下降 26%。这一变化主要来自能耗改善,管理效率的 > 影响尚无法分离 有把握的直说,没把握的说清楚不确定在哪里,不要对每句话都加限定。 **注意区分**:「约、左右、近」是**数值近似**,不是认知限定。数据密集的报告里 出现几十次「约」是精确性的体现,不要删。 **反向检查**:改完看有没有出现过度确定的句子。绝对化断言(「不是 X」「一律」 「总是」)如果证据只支持多数情况,要把限定语补回去。删限定语和加限定语是 同一条规则的两面,本条不是单向削减。 --- **A3 「的」字堆叠与嵌套** `实测·中文` 欧化定语直译的产物。危险信号:单句 3 个以上「的」,或出现「X 的 Y 的 Z」嵌套。 > 以获得他们对未来相关性将如何的最佳估计 → 以估计未来的相关性 改法是**把定语拆成谓语**。定语一长就往后拆成分句,不要堆在名词前面。 --- **A5 「被」字滥用** `实测·中文` 英文被动直译。中文表被动手段更多,很多情况下根本不需要标记。改法优先级: 改主动 → 用「受、由、经、获」→ 保留「被」(仅在强调受害或确实需要标记时)。 --- **A6 轻动词结构** `实测·中文` 「进行、加以、予以、作出」加名词化动词,是翻译腔的典型标记。 > 对上述数据进行了系统性的分析 → 分析了上述数据;对结论加以验证 → 验证了结论 --- **A7 中文破折号** `实测·中文` 人写中文各语域正文里密度接近零,教科书和政府公文是精确的零。机器用它做 戏剧性揭示。按 GB/T 15834 中文破折号是全角 `——`,合法用途只有解释说明和 话题转换,商务学术正文里**改用逗号、冒号或括号**。 > 结论很明确——成本控制是唯一可行的路径 → 结论很明确:成本控制是唯一可行的路径 --- **A8 「请注意」类祈使句** `实测·中文` `Note that` 的直译。七组人写中文语料里出现频率**全部为零**,是最接近二值 判据的一条。改法是把它承载的转折并进句子。「值得注意的是」是合法的中文 衔接词,可以保留,但一篇里别超过一两次。 --- **A22 搭配错配** `设计·中文` 词都对,配对在中文里没有。模型按语义角色组合词,母语写作者按既有说法取用, 两者的产物不一样。这一类是**词表查不出来的**,只能逐句反查。 **判据一,反查常规宾语。** 拿动词想它最常搭配的三到五个宾语。目标宾语不在 其中、也不属于同一语义类,就是错配。 > 磨 → 刀、墨、豆子。排比不在其中:**磨掉排比** → 拆散排比 > 承担 → 责任、费用、风险、后果。语域不在其中:**承担语域** → 维持语域 **判据二,看需不需要辩护。** 要解释这个搭配为什么成立,它就不成立。既有 搭配是取用来的,不需要论证。 **改法:先说出实际发生了什么,再选那件事的常规动词。**「磨掉排比」里实际 发生的是翻译把排比拆成了散句,那就写「拆成散句」。 三种形态:动宾错配(磨掉排比、承担语域)、定中生造(深度赋能、全面打通)、 术语跨域挪用(护栏、对齐、降档、跑偏)。第三种与 B1、B5 重叠,按 B 族处理; 前两种归 A 族,一律改。 **规则名、标题、清单项优先受检。** 它们会被复制到别处,一处错误会变成多处。 --- **英文侧:名词化与虚位主语** `沿用·英文` 英文侧未经本项目语料验证,按上游规则执行。 - `conduct an analysis` → `analyze` - `There is a need to reduce costs` → `Costs must fall` - `the improvement of the efficiency of the process` → `process efficiency gains` 方法学章节的被动语态是合法的,不要一律改主动。 --- **中英通用:聊天残留与元评论** `沿用·中英` 删掉「希望这对你有帮助」「以下是……」「让我为你分析一下」、知识截止声明、 能力免责、「作为一个 AI」类自我指称。正文里不出现表情符号,商务学术场合 零容忍。 --- **D1 不要拆散四字格和排比** `实测·中文·反向规则` 这一条**禁止改写**,放在这里是因为它最容易被 A 族规则误伤。实测显示人写 中文使用三字格和四字格排比的频率是机器翻译的 **2 到 10 倍**。排比是汉语的 本土节奏手段,机器不会用。看到「稳增长、调结构、促创新」这类结构, **不要拆成散句**。 唯一例外:空洞的宣传口号连排(「高质量发展、深层次变革、全方位提升」且不含 具体信息)按 B 类处理,理由是语域不合,不是像机器写的。 --- ### B 类规则:语域不符,按目标调整 判据是**这份文档该用多少**,不是“超过多少就是 AI”。实测的抽象名词阶梯: ``` 英文 教科书 < 10-K < 联合国文件 < 政府白皮书 中文 教科书 < 年报 < 央行报告 < 白皮书 < 咨询研究报告 ``` **B1 抽象名词与 buzzword** `实测·中英` 中文:赋能、闭环、抓手、生态、护城河、飞轮、颗粒度、打通、对齐、组合拳 英文:landscape、ecosystem、paradigm、synergy、holistic、leverage、framework 判断方法:**删掉这个词,句子的信息量有变化吗?** 没有就删。 > 通过数字化赋能打通产业链堵点,构建全方位的产业生态闭环 → > 把订单数据接入供应商系统,交货周期从 21 天压缩到 9 天 「体系、机制」在央行与政策文本里有确切所指,不要一律删。判据始终是有无所指。 **B2 增强语堆砌** `实测·中英` 中文:至关重要、显著、全面、深入、有力、高质量、切实、大力 英文:significant、crucial、essential、critical、robust、comprehensive 这些词不提供信息,只提供语气。有数据就给数据。 **B3 名词化后缀堆叠** `实测·中文` 「性、化、度、率、力、感」。实测无区分度,人写区间完全覆盖机器区间, 所以只是语域标记,不作机器痕迹判据。 **B4 比喻的使用** `设计·中英` **说明性类比**:用熟悉的事物解释陌生机制,本体与喻体都点明,带显式标记 (相当于、类似于、可以看作)。判据是删掉它读者还能不能理解这个机制,不能 就保留。约束按局部算,不按篇幅算:一个机制一个类比,同段不超过一处, 相邻两段不连续。全文无上限。**该给却不给,同样是缺陷。** **修辞性比喻**:本体已说清,比喻只添色彩,一律改直陈。三种形态:暗喻、 抽象操作物理化(挂数据、砍掉、打通、闭环、抓手)、拟人(数据告诉我们)。 判据同 B1。 > 整套规则挂在一把五级标尺上 → 规则分五级 **方向性词语**:「方向相反、反过来、搞错了方向」是空间比喻,机器用得远多于 人。判据是**能不能指出那条轴**:说得出哪个量沿哪个方向变化、不等号怎么翻转, 保留;说不出,按实际关系改写成「冲突」「错误」「不同」。反向要求按 A2 校准:真有方向翻转却写成「不同」,是信息损失。 警句式比喻(「数据是新时代的石油」)是本条的极端形态,见 A17。 **B5 优先使用中文固有词** `设计·中文` 材料与用户都没有指定术语时,选词优先用中文固有说法,不用外来语直译。 **判据:这个词是不是某个英文词的直译,而中文里本来另有说法。** 下面的对照 只是示例,不是清单,直译词列不完。 > 基线 → 标准;场景 → 情况;维度 → 方面;复用 → 重复使用;对标 → 参照; > 落地 → 实施;触达 → 送达;链路 → 环节;护栏 → 例外、限制 两条例外。一、**本领域中文文献通用的术语不算**:语域、名词化、分位数、 变异系数都是借来的或新造的,但它们是各自领域的通用说法,换掉反而看不懂。 二、**没有自然的替换就保留**,不要硬造。 这条换的是词的来源,不是层级。标准和基线一样专业。材料里已出现的术语按 D2 一字不变地复现。 ### 按目标语域取值 - **执行摘要、投资备忘录、尽调报告**:参照 10-K,抽象名词降到最低,结论 前置,每个判断给出数据 - **学术论文**:参照教科书与专著,允许适度名词化,限定语与证据强度相称 - **政策建议、白皮书**:抽象名词密度天然较高,但仍要求每个概念后面有具体做法 ## 判定纪律 ### 共现才算证据 **单个指标不构成判定依据。** 几乎每个指标的人写区间和机器区间都相邻,有些 直接重叠。中文侧的连接词和认知限定是少数无重叠的例外。 一个破折号、一次「此外」、一个弯引号都说明不了任何事。**同一段出现两处以上 不同痕迹才是修改信号,超过两处已经影响阅读观感。** 注意是**不同**痕迹共现, 不是同一痕迹反复出现。 ### 不要误判为 AI 的东西 以下特征单独出现时**不是** AI 痕迹:文字干净风格统一、正式或学术词汇、 孤立的连接词、弯引号与全角标点、单个破折号、单个短句、没有引用、规范的 复杂排版、引文与标题内部的敏感词、合理的免责与范围声明、读者真会考虑的 备选方案。 最容易误伤的三处:**引文内部不改**,被讨论的词和被使用的词不一样;**法律 与安全提示不删**,那是责任要求;**设计文档里的备选方案不删**。逐条理由见 `patterns-zh.md` 的假阳性防护一节。 ### 要保留的人写痕迹 除非损害准确性一律保留:具体而不寻常的细节、未解决的张力(「这个结论我 大致相信,但有一点始终解释不通」)、句长的自然起伏、真实的自我修正与 插入语、有据可依的第一人称选择。 ## 第三步:两种使用模式 ### 审校模式(默认) 1. 判定目标语域(正文默认 L2,对话按 L3) 2. **逐句读一遍**,标出 A 类问题。这一步有两种检查,都要做:一是词表提示的 那几类(连接词、限定语、「的」、「被」、轻动词、破折号),二是词表查不到 的搭配问题(A22),后者要逐句取出动宾对和定中对反查常规搭配。 **不要用词表代替阅读。** 3. 确认痕迹是否共现,不要凭单条下判断,再改 A 类 4. 对照目标语域检查 B 类,按需调整 5. **改完自查两个问题**:还有哪里读着像机器写的?**改写有没有增加或删除 任何事实、名称、数字、日期、引语、引用、排序或其他主张?** 任何无依据的 新增或丢失都算错误,必须回退。 6. 输出 第 5 步的第二问是硬性的。去 AI 味的过程中丢掉一个数字,比留着 AI 味严重得多。 ### 起草模式 写之前先定语域,然后结论前置,不要背景铺垫开场;每个判断后面跟数据、出处 或明确的不确定性说明;想写抽象名词时先问能不能换成具体动作;连接词能省 就省;**动宾与定中搭配取汉语里既有的说法,不按语义拼合新的**。写完自查 A1、A2、A8、A22 四条,这四条最容易犯。 ## 输出形态 **粘贴文本(默认)** 改写稿放进引用块按目标语域;变更清单在块外按 L3, 每条注明命中的规则编号和理由。商务场合改稿常要向上解释依据。 **指定文件** 跑完整流程,只把最终文本写进文件,然后给一句话摘要,摘要 留在对话里按 L3。**只改散体文字**:代码块、YAML、数据表、链接地址、公式 一律不动。 **其他任务调用时** 只返回最终文本,不附清单和说明。 ## 绝不做的事 - 不要为了“像人写的”注入个人情绪、幽默、锋芒或第一人称抒情,商务学术 语境里这会直接损害可信度 - 不要把语域降到 L4 以下,正文与对话都一样 - 不要改动数字、单位、口径、专有名词,以及**材料里的术语**。材料里的术语 必须一字不变地复现。改写中自己新造的说法不在此列,同样要过 A22 - 不要删除有证据支撑的限定语。10-K 风险因素章节的限定语是法律要求 - 不要凭 buzzword 密度判定文本是 AI 写的,那是语域标记不是作者身份标记 - 不要编造引用、DOI 或数据来源。原文没有出处就标注缺失,不要补一个 - 不要拿词表当检查清单。词表列的是示例,漏网的永远比列出的多 ## 参考文件 - `references/patterns-zh.md` 中文条目全表、实测取值、假阳性防护逐条理由 - `references/patterns-en.md` 英文条目全表,含实测否定的三条规则 - `references/register-business.md` 商务文体:金字塔原理、执行摘要、图表与建议表述 - `references/register-academic.md` 学术文体:IMRaD、CARS、元话语校准、引用可核查性 语料构成、量化依据与已知局限见仓库根目录的研究说明文档。许可与衍生关系见 `LICENSE` 与 `NOTICE.md`。