标签: LLM
与该标签相关的技术文章合集。 "LLM".
Agent 评测工程化(九):把一次性评测变成持续优化体系
一次评测发现问题,持续评测才形成质量体系。
AIAgentLLM发布于
Agent 评测工程化(六):评测前,先把 Agent 输出拆开
评测前先看懂答案,否则分数只是误读的结果。
AIAgentLLM发布于
Agent 评测工程化(五):让 LLM-as-judge 稳定输出结构化结果
模型负责判断语义,系统负责守住协议边界。
AIAgentLLM发布于Agent 评测工程化(四):红线、一票否决与 1-5 分
分数只有能回到规则,才有讨论和修复的空间。
AIAgentLLM发布于
Agent 评测工程化(三):从低分样本到问题簇
单条 badcase 只能讨论,问题簇才能进入排期。
AIAgentLLM发布于Agent 评测工程化(二):Rubric 不是 Prompt,而是可执行的质量协议
Rubric 不是更长的 prompt,而是系统可执行的质量协议。
AIAgentLLM发布于
Agent 评测工程化(一):为什么不能只看平均分
平均分回答不了红线,也推不动下一次修复。
AIAgentLLM发布于
给生产 Agent 做体检(四):LLM 输出不完美怎么办——归一化、一次修复与失败隔离
一条坏行止步于自己,一次修复就足够。
AIAgentLLM发布于给生产 Agent 做体检(三):让 LLM 稳定输出结构化诊断——严格 JSON Schema 实践
协议不在 prompt 里祈祷,而在 Schema 里强制。
AIAgentLLM发布于
给生产 Agent 做体检(二):诊断之前,先定义人口——数据质检与风险筛选
诊断之前先定义人口,规则永远跑在模型前面。
AIAgentLLM发布于