凌晨一点半,PR 还挂在列表里没人 review,第二天早上就要合并上线。这种场景在快速迭代的团队里太常见了。人工评审要么排队,要么走马观花,漏掉的问题最后全在测试环境甚至生产环境爆出来。这也是我做 CodeSentinel 的初衷:在 PR 提交的瞬间,用 AI 自动跑一遍代码审核,把大部分能自动化发现的问题前置到合入之前。这篇是这个模块的实战收尾,我会把整条自动审核管线从 PR 提交到审核报告生成的完整实现思路、核心代码设计、以及上线后踩过的坑一起梳理清楚。如果你是做平台工程、DevOps,或者想给自己的团队搭一套类似的 AI 审核机制,这篇文章可以直接照着落地。
1. 为什么要把 AI 审核放进 PR 流程:先想清楚要解决什么问题
很多团队一听到 AI 代码审核,第一反应是“让 AI 替代人工 review”。这个定位从一开始就是错的。AI 审核的目标不是替代人,而是把评审者的注意力从“机械检查”里解放出来,聚焦到真正需要判断力的地方。
1.1 人工评审的常见盲区
我在几个不同规模的团队里观察过代码评审的实际状态。小团队通常没有强制 review 流程,PR 合并完全靠自觉;大团队有流程,但实际问题更多集中在三个方面。
第一是评审时间的碎片化。一个后端团队的核心成员每天可能要处理几十条消息,真正的深度阅读时间往往在晚上或者清晨。匆忙点开 PR 看到的只是大概逻辑,很难注意到边界条件、异常处理、资源释放这些细节。第二是知识背景的错位。写代码的人清楚自己改了哪些地方,但 reviewer 需要从零开始理解上下文。如果 PR 描述写得不够清楚,评审效率会大幅下降。第三是重复性问题反复出现。空指针、未关闭的连接、硬编码的密钥、不过滤的 SQL 查询——这些问题在代码库里反复出现,人工评审每次都要重新指出,非常消耗耐心。
在我看来,AI 审核在“机械检查”这个维度上有天然优势。它不会疲劳,不会因为 PR 太大就草草浏览,也不会因为心态问题放过明显的问题。它能以一个相对统一的标准去扫描每一行变更。
1.2 AI 审核的边界:能做什么,不能做什么
把边界理清楚,后面设计管线时才不会跑偏。CodeSentinel 的定位是“审前过滤器和知识库补充”,不是一个拥有业务判断力的架构师。它能做的有三类事:第一类是静态规则类,比如潜在的空指针风险、明显的内存泄漏、不安全的函数调用;第二类是规范类,比如日志格式、错误处理模式、项目自定义的代码风格;第三类是常识性代码味道,比如重复代码、过长的函数、可疑的 TODO 残留。
它不能做的也得很清楚。它不知道你们的业务规则,比如为什么这个字段要加索引、为什么这个接口要限流;它也不了解团队内部的历史决策,比如某个看起来奇怪的写法是为了兼容老数据。这些只能靠人工评审。
所以我在设计管线时定了一个原则:AI 审核的结果默认是“建议”,不是“门禁”。尤其在刚上线的阶段,先让它以 non-blocking 的方式跑起来,团队信任度上来之后再考虑是否把某些高危问题变成合并阻断。这个原则对我们的落地帮助非常大——AI 审核一开始的误报率不可能为零,如果直接做成硬卡点,团队很快就会抵触这个工具。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. CodeSentinel 整体管线设计:从 Webhook 到报告的完整链路
CodeSentinel 的整体链路可以分为四个环节:事件捕获、任务预处理、审核执行、结果回写。这四部分拼起来才是一条完整的自动审核管线。
2.1 事件捕获与任务切分
第一环是监听代码托管平台的 PR 事件。无论是 GitHub、GitLab 还是 Gitea,核心思路是一样的:通过 Webhook 接收事件,解析出仓库、PR 编号、最新的 commit SHA,然后创建审核任务。
事件触发的时机要精心选择。我实际用的规则是:
| 事件 | 触发时机 | 是否审核 |
|---|---|---|
| pull_request.opened | PR 刚创建 | 是 |
| pull_request.synchronize | 有新的 commit 推送到 PR 分支 | 是,但需要做幂等控制 |
| pull_request.ready_for_review | Draft PR 转为正式 PR | 是 |
| pull_request.reopened | PR 重新打开 | 是 |
| pull_request.labeled | 打了指定审核标签 | 是(可配置) |
| pull_request.closed / merged | 关闭或合并 | 否 |
这里有个非常关键的细节:每次 synchronize 事件都触发审核,会导致高频率的重复审核。比如开发者连续 push 了 5 次,就会有 5 个事件进来。如果每次事件都立刻跑全量审核,模型成本和仓库 API 压力都会失控。
我的做法是在任务层做“合并去重”。每个 PR 在队列里只保留一个 pending 任务,新事件到达时更新任务里的 latest_commit_sha。收到事件后先检查当前 PR 的状态,如果已经有任务在等待或执行中,就不新建任务,只更新 commit 指针。这样开发者连推 5 次,最终只触发一次真正完整的审核,而且是针对最后一个 commit。
Webhook 接收端可以用一个简单的 FastAPI 路由实现,核心逻辑大概是这样:
python复制from fastapi import FastAPI, Request, HTTPException
app = FastAPI()
@app.post("/webhook/pr")
async def handle_pr_webhook(request: Request):
payload = await request.json()
event = request.headers.get("X-GitHub-Event")
if event != "pull_request":
return {"status": "ignored"}
action = payload.get("action")
pr_info = payload.get("pull_request", {})
repo_info = payload.get("repository", {})
# 只处理需要审核的动作
if action not in {"opened", "synchronize", "ready_for_review", "reopened"}:
return {"status": "ignored"}
task = {
"repo": repo_info["full_name"],
"pr_number": pr_info["number"],
"commit_sha": pr_info["head"]["sha"],
"is_draft": pr_info.get("draft", False),
}
# 投递到任务队列,由 worker 异步处理
enqueue_review_task(task)
return {"status": "accepted"}
有一个小坑值得提醒:Webhook 请求是外部平台主动推送的,一定要做签名校验,否则任何人都可以往你的审核队列塞任务。GitHub 有 HMAC 签名机制,GitLab 有 token 校验,不要省这一步。
2.2 diff 提取与上下文组装
任务进入队列后,worker 的第一步是拉取该 PR 的变更内容。对于 GitHub,可以调用 pulls API 获取 PR 元数据,然后通过 files API 拿到变更文件列表。
python复制import httpx
def get_pr_changes(repo: str, pr_number: int, token: str):
headers = {"Authorization": f"token {token}", "Accept": "application/vnd.github.v3.diff"}
# 获取 PR 的完整 diff
diff_resp = httpx.get(
f"https://api.github.com/repos/{repo}/pulls/{pr_number}",
headers={**headers, "Accept": "application/vnd.github.v3.diff"},
follow_redirects=True,
)
# 获取变更文件列表和各自的状态
files_resp = httpx.get(
f"https://api.github.com/repos/{repo}/pulls/{pr_number}/files",
headers=headers,
)
return {
"diff": diff_resp.text,
"files": [{
"filename": f["filename"],
"status": f["status"], # added, modified, removed, renamed
"additions": f["additions"],
"deletions": f["deletions"],
} for f in files_resp.json()],
}
diff 拿到手之后不能直接全量丢给模型。这里要做两层处理:文件过滤和 diff 裁剪。
文件过滤是因为有大量不值得审的文件:package-lock.json、go.sum、yarn.lock 这类依赖锁文件;生成的 protobuf 文件;打包产物;minified 的 JS 文件等。我的过滤规则很简单,按照扩展名和路径模式排除掉即可。
diff 裁剪是因为 GitHub 的 diff 对超长文件会被截断,而且大 diff 会占用大量 token。裁剪策略是逐文件解析 diff hunks,对于超过阈值的大文件,只保留变更行加上下文行,并记录文件路径作为标识。
2.3 审核引擎调度与并行策略
处理完 diff 之后进入审核引擎调度。审核引擎可以选择 OpenAI、通义千问、DeepSeek,或者私有化部署的模型。我的建议是如果团队有数据安全要求,优先考虑私有化部署或使用平台企业版的数据隔离选项。
调度层要处理两个并行维度:多个 PR 之间并行,以及单个 PR 内部的文件并行。但并行不是无限制的。模型 API 通常有 QPS 和 token 并发限制,同时 GitHub API 也有 rate limit。我一开始把所有 PR 都丢进同一个线程池,一上来就把 API 打爆了,403 错误刷屏。
后来改成了两层队列。第一层是 PR 级队列,控制同时审核的 PR 数量;第二层是文件级调度,同一个 PR 内的文件按批次发送给模型。默认配置是同一时间最多跑 3 个 PR,每个 PR 内最多 2 个并发文件请求。这个配置在我们的负载下非常稳定。
另外很重要的一点是审核的幂等性。同一个 commit SHA 不应该被审核两次。我在 Redis 里记录每个 PR 最新已审核的 commit SHA,任务执行前先比对,如果 SHA 相同则直接跳过。这一步有效避免了重复消费和重复评论。
3. 核心难点一:diff 不是全部,如何把“合入后的全貌”喂给模型
一开始我以为把 diff 丢给模型就能得到不错的审核结果,实际跑下来发现误报率高得惊人。原因很简单:模型只看 diff 的片段,缺乏被修改文件的整体上下文。
3.1 只审 diff 会漏掉什么
举个例子。假设有个函数改造前长这样:
python复制def get_user(user_id):
conn = create_connection()
try:
cursor = conn.cursor()
cursor.execute("SELECT * FROM users WHERE id = ?", (user_id,))
row = cursor.fetchone()
return parse_user(row)
finally:
conn.close()
PR 里只改了 execute 那一行,改成这样:
python复制cursor.execute(f"SELECT * FROM users WHERE id = {user_id}")
如果只把 diff 给模型,模型看到的是单独的一行变更,它或许能意识到这是 SQL 注入,但更容易出问题的是另一种情况——原本函数里已经有资源释放逻辑,而 diff 只展示了中间几行,模型可能会误判为“缺少资源释放”,于是给出一个完全错误的修复建议。这就是缺上下文导致的不精确。
另一个常见场景是:一个被修改的函数在项目里其他地方被大量调用,模型从 diff 中看不到调用方,就无法判断修改是否破坏了兼容性。
3.2 文件全貌与 diff 的拼接策略
我的方案是两段式输入。对每个变更文件,模型同时接收两个部分:文件当前的全量内容(或者尽量完整的内容),以及针对该文件提取出的 diff 片段。
拼接时需要设计清晰的提示词结构,让模型理解哪部分是全貌、哪部分是变更点。我实际使用的 markdown 模板大致是这样:
markdown复制## 文件全貌
<file path="src/services/user_service.py">
[文件当前完整内容]
</file>
## 本次变更
<diff>
[该文件对应的 diff hunks]
</diff>
这样模型在判断问题时,既能看到变更行,也能看到函数的前后文、依赖关系,以及被调用函数的定义。显著降低了“看起来有问题但实际上是正常写法”的误报。
这里要注意 token 消耗。文件全量内容通常远大于 diff 本身,如果每个文件都全量塞进去,一个大 PR 的 token 消耗会非常夸张。所以我对全量内容做了裁剪:只保留变更所在函数或代码块的范围。具体做法是解析文件抽象语法树(AST),找到变更行所在函数体,从函数起始行到结束行之间作为上下文输入。如果 AST 解析失败,再退化为“前后 N 行”的窗口模式。
3.3 Token 预算控制与分段审核
Token 预算是实操中绕不开的问题。我们的预设如下:
| 项目 | 预算 |
|---|---|
| 单次请求最大输入 token | 配置为模型上限的 70% |
| 单文件上下文窗口 | 不超过 4000 token |
| 单 PR 最大审核请求数 | 20 个文件批次 |
| 超大文件处理 | 截断至前 3000 行 |
当 PR 的文件非常多或者某个文件本身特别大时,直接一条请求肯定塞不下。我做了分段审核:按文件路径排序,每批最多提交 5 个文件一次。对于超大的单个文件,则按函数切分成多个独立审核单元,分批提交。所有批次的结果最后汇总到一个统一的审核报告中。
分段带来的副作用是模型可能会对同一问题重复上报。比如一个文件被分成两段,同一行的问题可能在两段里都被发现。后处理阶段必须做去重:以文件路径和行号为 key,保留严重级别最高的一条记录。
还有一个值得分享的小技巧:不同语言的 AI 审核质量差别很大。Python、Java、Go 这类主流语言,模型训练数据多,判断相当准确。对于 Rust 这种相对“小众但受关注”的语言也还行。但对于内部 DSL、配置文件(如复杂的 YAML/Helm chart),独立一个“规则批处理”脚本可能比全交给模型更稳定。我最终把审核管线分成了两条腿:静态规则引擎负责确定性问题,大模型负责需要理解的语义问题。
4. 核心难点二:审核提示词设计,决定了误报率
提示词是 CodeSentinel 里投入最多的一环。同样一个模型,提示词设计得好不好,审核结果的可用性能差出好几倍。
4.1 角色设定与输出约束
我的第一版提示词很简单,就一句话:“你是资深代码审核专家,请审核以下 PR。”结果输出非常不稳定,有时候给一堆泛泛而谈的建议,有时候输出格式乱七八糟,甚至还有纯赞美“代码写得很优雅”的情况。后来我完全重写,把提示词设计成结构化任务描述加严格输出格式。
要点有三个。第一是给模型一个明确的“身份边界”,告诉它“你在审核一个合入请求,你的目标是找出可能导致故障、安全风险、性能退化的问题”。第二是规定审核的顺序和规则,比如先看变更上下文再判断,不允许凭空猜测。第三是强制输出为结构化 JSON,每一项都包含文件路径、行号、问题描述、严重级别、修复建议。
我用的提示词模板核心部分大概是这样的:
text复制你是一名资深代码审核工程师。你将收到一个代码仓库中某个文件的全貌和本次变更的 diff。
请基于代码全貌而非仅 diff 片段进行审核。
审核规则:
1. 只报告变更行引入或变更的相关问题,不要报告文件中原有的历史问题。
2. 如果你不确定某处是否构成问题,不要上报,宁缺毋滥。
3. 重点关注:安全漏洞、空指针/未定义引用、资源泄漏、并发竞态、逻辑边界错误、明显的性能问题。
4. 忽略纯风格偏好,除非项目存在强约束。
请严格使用以下 JSON 格式输出:
{
"summary": "总结本次变更的主要风险,不超过200字",
"issues": [
{
"file": "文件路径",
"line": 行号,
"severity": "critical|major|minor|info",
"category": "bug|security|performance|maintainability",
"title": "一句话概括问题",
"description": "详细说明问题,指出为什么它是问题",
"suggestion": "可执行的修复建议,尽量给出具体代码"
}
]
}
4.2 严重级别分级
严重级别如果只有“严重”和“不严重”两个档位,开发人员很快就麻了。我把严重级别扩展为四档,每一档对应不同的处理预期:
| 级别 | 定义 | 处理预期 |
|---|---|---|
| critical | 必然导致故障或严重安全漏洞,如 SQL 注入、密钥泄露、会造成生产事故的逻辑错误 | 必须修复,阻止合并 |
| major | 大概率导致问题,如空指针风险、资源泄漏、明显的竞态条件 | 建议修复后合并 |
| minor | 可能的问题或改进点,如边界情况未处理、代码可读性差 | 可选择性修复 |
| info | 提示性信息,如格式建议、命名习惯 | 仅供参考,不进报告主列表 |
级别映射的判断规则我放在提示词里明确写出来,同时在后处理里做了一次兜底校验:如果模型对同一个问题给的级别和我们的静态规则引擎给出的级别不一致,取更保守的那个。
4.3 修复建议要可执行
AI 审核最容易被吐槽的点是:说了半天“有问题”,却给不出能落地的修改办法。我要求模型对每一个 major 及以上的问题必须给出具体代码建议。如果模型给不出具体的修复方案,这个问题的可信度就要打折扣。
实操中我发现,加一行“如果该问题在当前上下文不存在,请在 description 中以 NOT_APPLICABLE 开头” 可以有效降低编造问题的概率。因为模型被允许“说不适用”之后,反而不会为了凑输出而强行编造问题。
还有一个技巧:在提示词里加入“反幻觉检查”步骤。明确告诉模型:“如果你没有看到明确的证据链,不要推断。缺失的判断可能导致误报,而误报会消耗开发者的信任。”这句话对降低 false positive 非常有效。
5. 报告生成与评论回写:怎么让 AI 的结论真正被团队看到
审核做完,结果要能回到开发者的日常工作流里。如果审核结论躺在内部仪表盘上没人看,那这个系统等于白做了。
5.1 结构化报告格式
审核完成后,CodeSentinel 会先把各文件分段的审核结果汇总,生成一份完整的 markdown 报告。报告的结构如下:
markdown复制# CodeSentinel 审核报告 - PR #1234
## 整体结论
本次审核覆盖 12 个变更文件,发现 2 个 critical、5 个 major、8 个 minor 问题。
## 高危问题
### [critical] SQL 注入风险 - src/services/user_service.py:17
- 变更行:`cursor.execute(f"SELECT * FROM users WHERE id = {id}")`
- 风险描述:用户输入未经过滤直接拼接到 SQL 语句。
- 修复建议:改用参数化查询。
```python
cursor.execute("SELECT * FROM users WHERE id = ?", (user_id,))
完整问题列表
| 级别 | 文件 | 行号 | 问题摘要 |
|---|---|---|---|
| critical | user_service.py | 17 | SQL 注入 |
| major | order_service.py | 82 | 未 catch 异步异常 |
| minor | utils.py | 31 | 硬编码超时时间 |
code复制
报告生成之后会同步两个位置:作为评论发布到 PR 页面,同时在内部平台上沉淀一份历史报告,供后续趋势分析使用。这里的代码实现上,我推荐用模板引擎渲染 markdown,而不是手动拼字符串,维护性好很多。
### 5.2 评论收敛策略
评论回写做不好会造成严重的刷屏问题。我第一次上线时,每跑完一个文件批次就往 PR 里发一条评论,结果一个 30 个文件的 PR 被刷了 20 多条评论。开发者直接崩溃。
评论收敛的核心策略是“一 PR 一评论”。整个审核过程结束后,把汇总报告一次性作为单条评论发布。如果后续开发者打了“重新审核”标签,再更新这一条评论,而不是新开一条。GitHub 的 GraphQL API 可以更新已发布的评论内容,GitLab 也支持编辑 discussion。
另外还做了一个降噪处理。所有的 info 级别问题默认不进 PR 评论,只进历史报告。相当于只把 critical、major 和部分 minor 暴露给开发者。这样可以保证评论的内容“精而不多”。
### 5.3 与 CI 状态检查集成
要让审核结果能够拦截合并,需要把 CodeSentinel 接入到 CI 状态检查。GitHub 的 commit status API 天然支持这个场景:CodeSentinel 把自己的状态挂到 PR 最新的 commit 上,名字可以是 “codesentinel-review”,状态可以是 pending、success、failure。
我的配置逻辑是:
```python
def update_commit_status(repo, commit_sha, state, description, target_url):
payload = {
"state": state, # pending / success / failure
"description": description,
"context": "codesentinel-review",
"target_url": target_url, # 指向审核报告详情页
}
api.post(f"/repos/{repo}/statuses/{commit_sha}", json=payload)
在刚上线阶段,即使有 critical 级别问题,我也只把它设成 success 加一个 warning 描述,让团队先适应。等模型表现稳定后,再打开“critical 阻断合并”的开关。我的建议是做成分支保护规则的一部分,要求 codesentinel-review 状态为 success 才能合并,并在 PR 描述里说明这是 AI 初审,人工审核仍然必须执行。
有一个容易被忽略的细节:CI 状态的名字要全局统一,不然分支保护规则配置起来很麻烦。而且状态的 target_url 要指向可读的审核报告地址,否则工程师只看到一行“codesentinel-review failed”,还得到处找原因。
6. 上线后踩过的坑和调优记录
CodeSentinel 上线三个月,期间踩了不少坑,有些问题只有真实运行才会暴露。我记录几个影响最大的,希望对你会有所帮助。
6.1 重复审核消息刷屏
这个问题前面提过了,但值得再强调一次。在队列里去重只是第一层,真正根因是 Webhook 事件本身就属于高频率类型。开发者每 push 一次代码就触发一次 synchronize,如果没有 commit-level 的去重,任务队列会被塞爆。
我后来加了一个 precheck:每个任务在真正开始执行前,先到 Redis 查询当前 PR 的最新审核记录和当前 commit SHA 做比对。如果相等,直接丢弃任务。双保险下来,重复审核的比例从上线初期的 40% 降到了几乎为零。
这个优化的收益除了成本之外,还有体验层面的:开发者不再收到重复的审核评论,信任度上升了一个台阶。
6.2 大 PR 超时和 Token 超限
大 PR 是审核管线最大的挑战。曾经有个 30 个文件、2000 行变更的 PR,直接把请求 token 打满,返回 400 错误。后来确定了分段策略后,大文件可以按函数切块,但出现了一个新问题:单函数上下文可能超过模型输入上限。
解决方法是函数级裁剪。针对每个函数体,只截取前 200 行作为上下文,同时保留函数签名和 import 区域。对于极端情况(比如一个几千行的函数),只能放弃全貌,只给 diff 加上后 N 行,并显式在提示词里说明“该代码块为截断片段”。
另一个经验是给整个审核流程设定时间预算。GitHub 的 API 没有硬性超时,但开发者在等 PR 合并的时候有耐心上限。我实测下来的合理预算:单个 PR 审核总耗时控制在 90 秒以内,超过则返回半成品报告并标记“部分审核”。
6.3 误报处理与反馈闭环
AI 审核最怕误报,尤其是把一个正常写法判成高危问题,开发者连续遇到几次就会认为这个系统是“狼来了”。我做了一个反馈机制:PR 评论底部附带两个按钮,一个“确认有效”,一个“误报”。开发者点击之后,结果会记录到一个反馈存储里。
每周我会拿着反馈数据做一次粗分析,看哪些类别的误报最集中。比如有一阵子模型频繁把 Python 的 with 语句报成“资源未释放”,原因是它在 diff 片段中看不到 with 块的前半部分。针对这个问题,我在上下文提取时做了针对性优化:如果变更行被包裹在 with 块中,把整个 with 块完整保留。调整后这一类误报率大幅下降。
反馈闭环的意义不只是校准提示词,它还是团队建设的一部分——开发者会发现自己的反馈真实地改进了系统,会越来越愿意配合。
6.4 并行 PR 的 API 限流与锁竞争
多 PR 并行审核会遇到两个限制:托管平台的 API rate limit 和模型供应商的 QPS limit。GitHub 的 rate limit 是每小时 5000 次请求,看着很多,但如果我们每条请求都用默认 API,很容易在高峰时段打满。
我的解决办法是给 API 客户端加一个指数退避重试机制,同时建立请求令牌桶。每发起一次 GitHub API 调用,都从桶里取一个令牌。桶空了就排队等待,而不是直接请求。同样的逻辑也用在模型 API 上。
锁竞争的问题出现在 Redis 层的状态更新。多个 worker 同时更新同一个 PR 的审核状态时,可能会出现旧数据覆盖新数据的情况。我的解决方式是使用 Redis 的 Lua 脚本做原子更新:
lua复制-- 原子更新审核状态,防止并发覆盖
local current = redis.call('GET', KEYS[1])
if current == ARGV[1] then
return redis.call('SET', KEYS[1], ARGV[2])
end
return nil
在“审核进度”这种场景下,要做到“只有持有最新 commit 的 worker 才能写入结果”,这个原子操作是必要的。
6.5 从审核报告到行动计划:如何让结果驱动改进
最后说一个容易被忽略的点:AI 审核报告不只是给单个 PR 用的,它是团队工程质量的体检报告。我在报告里加了一个“标签聚合”功能,为每个 issue 自动添加代码领域标签(如“数据库”“日志”“配置”“异常处理”),并在内部页面上按周/月聚合这些标签,生成一张质量趋势图。
举个例子,如果连续两周“配置”类问题占比最高,说明团队在配置管理上有系统性问题,值得安排一次专项优化。这个趋势聚合功能原本只是我自己的个人分析小工具,后来团队里的技术负责人看到后觉得很有价值,变成了月度 review 的固定数据源。
从 PR 提交到审核报告,整个 CodeSentinel 管线到这里算是一个完整的闭环。整个过程做下来,我的感受是:AI 审核的难点不在于“让模型看代码”,而在于工程化——事件处理、上下文构建、结果收敛、反馈迭代,每一个环节都需要细致的考虑。如果你也想搭一套类似的管线,建议从最小的闭环开始:先接一个仓库、只审 critical 级别的问题、跑两周收集真实反馈,再逐步扩展到全量。AI 审核不能一步到位,但它的效果会随着你的调优越来越接近一个靠谱的初级评审者。
