标签: Agent
与该标签相关的技术文章合集。 "Agent".
Agent 评测工程化(九):把一次性评测变成持续优化体系
一次评测发现问题,持续评测才形成质量体系。
AIAgentLLM发布于
Agent 评测工程化(八):不用消息队列,也能跑长任务
评测任务慢且会失败,状态机比热闹架构更重要。
AIAgent后端发布于
Agent 评测工程化(七):从评分报表到 PM 决策工作台
报告不是字段展示,而是把评测结果翻译成决策路径。
AIAgent产品设计发布于
AI Native 不是工具升级,而是组织重写
数用了多少 AI 功能没有意义,要看多少流程被倒逼着重新定义。
AI组织转型Agent发布于DeepSeek Harness:把 Agent 宿主变成可组合的基础设施,企业能拿它做什么
Agent = Model + Harness,难的不是模型,是把它接进真实环境。
AgentDeepSeekAI 工程化发布于
Agent 评测工程化(六):评测前,先把 Agent 输出拆开
评测前先看懂答案,否则分数只是误读的结果。
AIAgentLLM发布于
Agent 评测工程化(五):让 LLM-as-judge 稳定输出结构化结果
模型负责判断语义,系统负责守住协议边界。
AIAgentLLM发布于Agent 评测工程化(四):红线、一票否决与 1-5 分
分数只有能回到规则,才有讨论和修复的空间。
AIAgentLLM发布于
Agent 评测工程化(三):从低分样本到问题簇
单条 badcase 只能讨论,问题簇才能进入排期。
AIAgentLLM发布于Agent 评测工程化(二):Rubric 不是 Prompt,而是可执行的质量协议
Rubric 不是更长的 prompt,而是系统可执行的质量协议。
AIAgentLLM发布于