标签: 工程实践
与该标签相关的技术文章合集。 "工程实践".
MCP 爆炸之后,Agent 怎么从一堆工具里选对那一个
工具越多,越不能把选择权全丢给模型。
MCPAI Agent工程实践发布于Agent 评测工程化(九):把一次性评测变成持续优化体系
一次评测发现问题,持续评测才形成质量体系。
AIAgentLLM发布于
Agent 评测工程化(八):不用消息队列,也能跑长任务
评测任务慢且会失败,状态机比热闹架构更重要。
AIAgent后端发布于
Agent 评测工程化(七):从评分报表到 PM 决策工作台
报告不是字段展示,而是把评测结果翻译成决策路径。
AIAgent产品设计发布于
Agent 评测工程化(六):评测前,先把 Agent 输出拆开
评测前先看懂答案,否则分数只是误读的结果。
AIAgentLLM发布于
Agent 评测工程化(五):让 LLM-as-judge 稳定输出结构化结果
模型负责判断语义,系统负责守住协议边界。
AIAgentLLM发布于Agent 评测工程化(四):红线、一票否决与 1-5 分
分数只有能回到规则,才有讨论和修复的空间。
AIAgentLLM发布于
Agent 评测工程化(三):从低分样本到问题簇
单条 badcase 只能讨论,问题簇才能进入排期。
AIAgentLLM发布于Agent 评测工程化(二):Rubric 不是 Prompt,而是可执行的质量协议
Rubric 不是更长的 prompt,而是系统可执行的质量协议。
AIAgentLLM发布于
Agent 评测工程化(一):为什么不能只看平均分
平均分回答不了红线,也推不动下一次修复。
AIAgentLLM发布于