生产案例 · JEV × SEO

把握度 0.89 的建议,是错的

Loomaly 把 Jev 用在真实网站的逐页审计、站内链接建议和转化检查中。速度和成本显著改善,但真正让结果可用的,是四组写在模型外面的代码规则。

发布于 2026-09-26约 12 分钟Loomaly production notes
00 / BASELINE

换成 Jev 前后,差在哪里

之前 · 生成式审计 53–170s

每页耗时;某天 190 次审计中有 163 次超时。

  • 同一页面重复运行会得到不同问题清单
  • 会报告输入证据里不存在的问题
  • 成本限制了覆盖范围,每次只检查 25 页
之后 · JEV 判断层 1–2s

每页约 $0.00003;便宜到可以逐页判断而不是抽样。

  • 153 个判断重复两遍,150 个结果一致
  • 泡泡玛特整站的一次 Jev 审计费用约 1 美分
  • 站内链接建议采纳率从 14% 提升到 80%

这些数字来自 Loomaly 2026 年 9 月的设计文档、校准记录和生产运行记录,不代表 Jev 在所有任务上的通用性能。

01
CONFIDENCE ≠ CORRECTNESS

把握度高,不等于对

Loomaly 让 Jev 判断一句话是否应该增加站内链接,再把用户真正采纳和拒绝的结果回填。两组平均 confidence 几乎没有区分力。

被采纳0.619mean confidence
被拒绝0.623mean confidence
最高把握度0.89但建议错误
错误案例
“What are the alternatives to Google Analytics?”

目标文章方向正确,但原句是 H2 标题。模型判断了语义相关性,却没有掌握“编辑不会在标题里加站内链接”这条发布规则。

同一次对账里,锚文本 Score 更有区分力:采纳建议平均 1.63,拒绝建议平均 1.39。Loomaly 因此在免费检查中只展示 1.4 分以上的建议。结论不是“Score 永远优于 confidence”,而是要保留在你的结果数据上真正有预测力的指标。

02
INPUT BOUNDARY

它只能根据你给它看的东西判断

第一次检查泡泡玛特网站时,Jev 把 168 个页面判成“内容太单薄”,又把 56 个在售商品页判成“没有给顾客下一步”。这些结论听起来专业,但输入本身是残缺的:正文由 JavaScript 加载,抓取结果接近空白;按钮数据也没有传入。

CODE

先判断是否有资格提问

正文少于 150 字符时,不再问“内容是否单薄”,而是报告非 JavaScript 爬虫读取为空。没有抓到按钮,就不问是否存在下一步。

JEV

只处理剩余的语义问题

输入完整且满足前置条件后,再判断内容是否具体、CTA 是否清晰或页面意图是否匹配。

开源项目 Jev SEO 采用相同边界:爬取、规则和打分由代码负责,Jev 负责页面类型、搜索意图、帮助性、具体性等语义判断。

03
QUESTION DESIGN

怎么问,决定了它怎么答

NEGATION

不要用否定句提问

“这个页面缺少作者信息吗?”会增加方向性错误。Loomaly 在调用前拦截否定句,统一改成“这个页面有作者信息吗?”。

NUMBERS

数字先由代码解释

页面长度、链接数量等数值先由代码计算并转换成明确类别,再把语义化结果交给 Jev。

SCOPE

一次判断一个页面

不要把多行页面数据塞进一次需要跨行排序的判断。Loomaly 原文转述了一项准确度从 0.97 降到 0.51 的外部测试,但没有附原始链接,因此本站将它保留为作者归因的观察,不视为已独立核验的基准。

04
PRODUCTION PARITY

第一次上线,50 条建议里 40 条早已存在

测试环境里,站内链接建议的采纳率从 14% 调到 78%。但上线后的第一批 50 条建议中,有 40 条是用户网站已经存在的链接。测试脚本与生产环境读取“已有链接”的方式不同,这个缺口在离线测试中没有暴露。

测试14% → 78%逐轮调整建议质量
→
首次上线40 / 50重复已有链接,本轮作废
→
修复后80%生产采纳率

最终提升的大头不是再调一次模型,而是代码逐项否决不该出现的候选:已有链接、用户拒绝过的建议、图片说明、目录条目、小标题,以及从词组中间截断的锚文本。仅图片说明这一类,就占某轮 26 条拒绝中的 14 条。

SHIP CHECKLIST

如果你也想在生产环境使用 Jev

  1. 先决定谁拍板。能数的交给代码,Jev 只回答代码无法直接判断的语义问题。
  2. 用真实结果校准。不要迷信 confidence,寻找真正能区分结果的指标。
  3. 给代码留否决权。删除、发布、扣款等不可逆动作不能因模型高分自动获得权限。
  4. 先检查模型看到了什么。输入为空或字段缺失时,应停止提问而不是接受漂亮但无依据的答案。