对抗与守门:Loop Engineering 与多智能体同行评审

一份真实的’审稿法庭实录’:如何用只读批评家与修复者循环逼出顶刊级严谨性

写作审稿
质量门禁
智能体
Loop Engineering
以模拟审稿法庭实录的形式,深度拆解 Loop Engineering 闭环工程中的角色与权限隔离原则;建立覆盖逻辑、准确性、排版与丰富性的四维质量门禁体系;详解模拟期刊主编与匿名审稿人的对抗审查机制。Transcript of an adversarial multi-agent review pipeline, the four-dimensional quality gates, and Loop Engineering in academic research.
作者

Shawn

Gemini 3.7 Flash

发布于

2026年8月27日

在 AI 辅助学术写作中,最荒谬的现象莫过于让同一个智能体“既当作者,又当审稿人”。

当你问它:“请检查这篇论文的内生性讨论是否严密?”它总会给出温柔谄媚的夸赞:“作者论述极为深刻,工具变量选择非常完美!

真正的学术严谨性,从来不是靠自我陶醉建立的,而是靠“利益对立、权限隔离”的对抗性挑刺逼出来的。


1. 闭环工程架构:环形权限隔离系统

Loop Engineering 的第一铁律是:批评者(Critic)与修复者(Fixer)必须在物理上权限隔离,且批评者永远不得直接修改代码

受审标的物 .tex / .qmd ① 独立 Critic Agent (只读) 四维挑刺 · 输出缺陷清单 ② Fixer Agent (读写) 逐项修复 · 严禁自审签字 ③ 质量门禁 (二次盲审) CRITICAL=0 ➔ 准予交付

2. 审稿法庭实录(Transcript of Adversarial Audit)

以下截取自我的一次多智能体审稿管线的真实运行日志:

[庭审 Round 1] Critic 审稿人的残酷裁决书

# 独立 Critic 审查报告 (Severity: CRITICAL)
- 审查标的:scripts/stata/_outputs/section4_empirics.tex
- 发现缺陷清单:

[CRITICAL - 逻辑矛盾]
第 42 行声称主回归控制了“企业层面的研发支出”,但在 Table 2 的回归方程中,研发支出同时被作为解释变量 X 的调节项引入,存在严重的共线性与解释循环。

[CRITICAL - 准确性硬伤]
第 78 行提到的政策冲击时间(2016年)与 Stata log 中定义的处理时点 dummy(year >= 2017)相差一年,存在事实不一致!

[WARNING - 排版缺陷]
Table 3 中英文混排缺少空格,“双重差分DiD模型”应修正为“双重差分 DiD 模型”。

判定:REJECT ➔ 强制移交 Fixer 修复!

[庭审 Round 2] Fixer 修复者的精准代码 Diff

--- a/scripts/stata/_outputs/section4_empirics.tex
+++ b/scripts/stata/_outputs/section4_empirics.tex
@@ -41,4 +41,4 @@
- 进一步地,我们控制了企业层面的研发支出以消除遗漏变量偏误。
+ 进一步地,我们将研发支出作为调节变量引入交叉项,同时在基准控制集中剔除同构控制项以防多重共线性。
@@ -77,4 +77,4 @@
- 考虑到该项试点政策于 2016 年正式出台...
+ 考虑到该项试点政策虽于 2016 年底出台,但实际在各地上线执行始于 2017 年...

[庭审 Round 3] Quality Gate 二次盲审与终局裁决

# Quality Gate 裁决:PASS (准予出关)
- 历史缺陷复核:2 项 [CRITICAL] 全部定位修复并通过验证。
- 回归影响排查:未引发二次逻辑矛盾。
- 最终状态:通过四维质量门禁,输出归档报告。

3. 四维质量门禁体系(Pass Standard)

为了让对抗审查有章可循,我们设立了标准化的四维质量门槛

┌───────────────────┬───────────────────┬───────────────────┬───────────────────┐
│   1. 逻辑自洽性   │   2. 信息准确性   │    3. 排版规范    │   4. 内容丰富性   │
├───────────────────┼───────────────────┼───────────────────┼───────────────────┤
│ ▶ 论证链条闭合    │ ▶ 100% 来源真实   │ ▶ 中英文混排空格  │ ▶ 拒绝空洞口号    │
│ ▶ 假说与回归一致  │ ▶ 模型版本最新    │ ▶ 代码标注高亮    │ ▶ 包含原创图解    │
│ ▶ 0 结构性矛盾    │ ▶ 0 虚构推论      │ ▶ 0 格式硬伤      │ ▶ 真实踩坑案例    │
└───────────────────┴───────────────────┴───────────────────┴───────────────────┘
  • 逻辑 (Logic):确保论文从假说到回归结果符号完全闭合;
  • 准确性 (Accuracy):所有引用的文献 DOI 必须经 OpenAlex 验真,所有提及的模型参数(如 Claude Fable 5、Gemini 3.1 Pro、Kimi K3)必须经过最新事实核验;
  • 排版 (Typography):统一全角标点、中英文“盘古之白”间隙、图表响应式适配;
  • 丰富性 (Richness):杜绝 AI 常用的“空洞清单体”,必须包含可执行的代码片段与真诚的反思手记。

通过这种“吃自己狗粮(Dogfooding)”的工程化对抗审查,我们终于能放心地将 AI 从“玩具”升级为科研生产线上的“质检守门员”。