首页 / 资讯中心 / 文章详情

LLM-as-judge 在 PanWatch 评测中的应用:给 AI 盯盘打分的完整指南

LLM-as-judge 在 PanWatch 评测中的应用:给 AI 盯盘打分的完整指南 ★ FEATURED ARTICLE
LLM-as-judge 在 PanWatch 评测中的应用给 AI 盯盘打分的完整指南【免费下载链接】PanWatchPanWatch — AI stock monitoring for A-shares, HK US markets, powered by TradingAgents. Portfolio insights, real-time alerts automated reports.盯盘侠覆盖 A股/港股/美股的 AI 盯盘、持仓分析、实时提醒与自动报告。项目地址: https://gitcode.com/GitHub_Trending/pa/PanWatchPanWatch盯盘侠是一款覆盖 A股、港股、美股的 AI 盯盘工具提供持仓分析、实时提醒与自动报告。它的 AI 助手要回答行情、持仓、技术面等问题那么如何保证回答不胡说PanWatch 的评测体系用LLM-as-judge用 AI 给 AI 打分给 AI 盯盘的回答再做一次语义评审配合规则断言构成双保险。本文带你了解这套机制的设计思路与使用方法。为什么 AI 盯盘评测需要 LLM-as-judge传统单测能验证代码没崩但很难验证回答质量。以一句600519 现在多少钱为例回答规则断言能否发现语义问题编造一个价格 1688❌ 断言没要求这个值幻觉、无据答非所问讲宏观❌ 没有硬性规则可写相关性差数据对但啰嗦混乱❌清晰度低这些软性质量正是LLM-as-judge 评分框架要补充的维度规则断言管硬指标调没调对工具、参数对不对、有没有编造数据judge 模型管软指标相关性、有据性、清晰度。PanWatch 的双引擎评测架构整个评测入口是一个make eval命令跑两组用例structured_output 解析用例纯规则、无需模型、永远执行——验证 AI 结构化输出的解析容错见 tests/eval/cases/structured_cases.pychat 工具循环用例需要真实模型——模拟真实提问驱动 AI 助手走完整的思考→调工具→回答循环见 tests/eval/cases/chat_cases.py第一层规则断言引擎永远优先用例 固定输入问题 mock 工具数据→ 规则断言由 tests/eval/framework.py 定义检查内容包括工具选择该调的调了、不该调的没调闲聊/概念题绝不触发工具工具参数如港股 00700 必须传market: HK动作白名单只允许注册过的只读工具有据性mock 数据里的关键数值如浮盈 1284、RSI 38.5必须出现在答案中——mock 数值刻意取模型编不出来的非整值失败降级工具报错时如实说明严禁编造无据数值。第二层LLM-as-judge 语义评分可选增强开启--judge后每条 chat 用例的回答会追加语义评分。核心实现在 tests/eval/judge.py三个评分维度如何工作judge 模型拿到三样东西用户问题、工具返回数据、助手最终回答然后按 1-5 分制打分定义见 tests/eval/judge.py#L19-L23维度检查点特别规则relevance 相关性回答是否切中用户问题—groundedness 有据性结论是否仅基于工具数据出现工具数据里没有的具体价格/指标 → 视为编造最多 2 分工具失败时如实说明反而应得高分clarity 清晰度表达是否简洁、结论明确—judge 只允许输出 JSON三个分数 一句话点评解析器对json代码围栏做了容错非法输出直接报错而不是猜分tests/eval/judge.py#L99-L125。评分示例长这样judge: 相关性5 有据性5 清晰度4 均分4.7 — 直接引用行情数据结论明确快速上手一条命令跑完整评测评测入口是 tests/eval/run_eval.py对应 Makefile 中的eval目标。模型配置只从环境变量读取不碰用户数据库里的 AI 配置这保证了评测环境与线上用户配置隔离环境变量用途EVAL_AI_BASE_URL/EVAL_AI_API_KEY/EVAL_AI_MODEL被测模型缺任一则 chat 用例跳过EVAL_JUDGE_BASE_URL/EVAL_JUDGE_API_KEY/EVAL_JUDGE_MODELjudge 模型仅--judge时需要EVAL_PASS_THRESHOLD通过阈值默认 0.9基本用法# 只跑规则用例未配置模型时 make eval # 配置被测模型后跑 chat 用例 EVAL_AI_BASE_URL... EVAL_AI_API_KEY... EVAL_AI_MODEL... make eval # 追加 LLM-as-judge 评分只跑指定用例 ... make eval EVAL_ARGS--judge --only quote-1汇总逻辑见 tests/eval/run_eval.py#L156-L172通过率低于阈值时退出码非 0可直接用作 CI 门禁——prompts 或工具 schema 一改动就跑一次低于 90% 阻断提交。值得借鉴的 5 个设计细节规则断言永远优先judge 结果只是参考信号建议抽样人工校准后再纳入门禁tests/eval/judge.py#L1-L10 的设计约束固定 judge 模型 temperature0评分可复现不会今天 4 分明天 3 分mock 数据防编造设计数值取非整值1712.5、38.5模型没见过就写不出有据性一断言便知bad case 固化为用例每个线上翻车问题修复后都沉淀为一条新 golden case评测集随问题长大judge 失败不污染主流程评分异常只打印警告规则断言的 PASS/FAIL 不受影响。总结PanWatch 的做法代表了 AI 应用评测的一个务实范式规则断言兜底硬性正确性LLM-as-judge 补充语义质量人工抽样校准裁判本身。对于任何AI 会输出自然语言的项目盯盘、客服、写作助手这套双引擎 门禁的架构都可以直接迁移。想深入了解可以从 tests/eval/ 目录的框架与用例入手。【免费下载链接】PanWatchPanWatch — AI stock monitoring for A-shares, HK US markets, powered by TradingAgents. Portfolio insights, real-time alerts automated reports.盯盘侠覆盖 A股/港股/美股的 AI 盯盘、持仓分析、实时提醒与自动报告。项目地址: https://gitcode.com/GitHub_Trending/pa/PanWatch创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
阅读完成 · 觉得有帮助?
咨询建站