把握度 0.89 的建议,是错的
Loomaly 把 Jev 用在真实网站的逐页审计、站内链接建议和转化检查中。速度和成本显著改善,但真正让结果可用的,是四组写在模型外面的代码规则。
换成 Jev 前后,差在哪里
每页耗时;某天 190 次审计中有 163 次超时。
- 同一页面重复运行会得到不同问题清单
- 会报告输入证据里不存在的问题
- 成本限制了覆盖范围,每次只检查 25 页
每页约 $0.00003;便宜到可以逐页判断而不是抽样。
- 153 个判断重复两遍,150 个结果一致
- 泡泡玛特整站的一次 Jev 审计费用约 1 美分
- 站内链接建议采纳率从 14% 提升到 80%
这些数字来自 Loomaly 2026 年 9 月的设计文档、校准记录和生产运行记录,不代表 Jev 在所有任务上的通用性能。
把握度高,不等于对
Loomaly 让 Jev 判断一句话是否应该增加站内链接,再把用户真正采纳和拒绝的结果回填。两组平均 confidence 几乎没有区分力。
“What are the alternatives to Google Analytics?”
目标文章方向正确,但原句是 H2 标题。模型判断了语义相关性,却没有掌握“编辑不会在标题里加站内链接”这条发布规则。
同一次对账里,锚文本 Score 更有区分力:采纳建议平均 1.63,拒绝建议平均 1.39。Loomaly 因此在免费检查中只展示 1.4 分以上的建议。结论不是“Score 永远优于 confidence”,而是要保留在你的结果数据上真正有预测力的指标。
它只能根据你给它看的东西判断
第一次检查泡泡玛特网站时,Jev 把 168 个页面判成“内容太单薄”,又把 56 个在售商品页判成“没有给顾客下一步”。这些结论听起来专业,但输入本身是残缺的:正文由 JavaScript 加载,抓取结果接近空白;按钮数据也没有传入。
先判断是否有资格提问
正文少于 150 字符时,不再问“内容是否单薄”,而是报告非 JavaScript 爬虫读取为空。没有抓到按钮,就不问是否存在下一步。
只处理剩余的语义问题
输入完整且满足前置条件后,再判断内容是否具体、CTA 是否清晰或页面意图是否匹配。
开源项目 Jev SEO 采用相同边界:爬取、规则和打分由代码负责,Jev 负责页面类型、搜索意图、帮助性、具体性等语义判断。
怎么问,决定了它怎么答
不要用否定句提问
“这个页面缺少作者信息吗?”会增加方向性错误。Loomaly 在调用前拦截否定句,统一改成“这个页面有作者信息吗?”。
数字先由代码解释
页面长度、链接数量等数值先由代码计算并转换成明确类别,再把语义化结果交给 Jev。
一次判断一个页面
不要把多行页面数据塞进一次需要跨行排序的判断。Loomaly 原文转述了一项准确度从 0.97 降到 0.51 的外部测试,但没有附原始链接,因此本站将它保留为作者归因的观察,不视为已独立核验的基准。
第一次上线,50 条建议里 40 条早已存在
测试环境里,站内链接建议的采纳率从 14% 调到 78%。但上线后的第一批 50 条建议中,有 40 条是用户网站已经存在的链接。测试脚本与生产环境读取“已有链接”的方式不同,这个缺口在离线测试中没有暴露。
最终提升的大头不是再调一次模型,而是代码逐项否决不该出现的候选:已有链接、用户拒绝过的建议、图片说明、目录条目、小标题,以及从词组中间截断的锚文本。仅图片说明这一类,就占某轮 26 条拒绝中的 14 条。
如果你也想在生产环境使用 Jev
- 先决定谁拍板。能数的交给代码,Jev 只回答代码无法直接判断的语义问题。
- 用真实结果校准。不要迷信 confidence,寻找真正能区分结果的指标。
- 给代码留否决权。删除、发布、扣款等不可逆动作不能因模型高分自动获得权限。
- 先检查模型看到了什么。输入为空或字段缺失时,应停止提问而不是接受漂亮但无依据的答案。