归档
按发布年月归档的全部文章,便于按时间回顾技术实践与思考。
MCP Server 升级 2026-07-28:不是换依赖,而是重画协议边界
发布于删掉协议层 session,MCP Server 才第一次能水平扩展。
Agent 评测工程化(九):把一次性评测变成持续优化体系
发布于一次评测发现问题,持续评测才形成质量体系。
Agent 评测工程化(八):不用消息队列,也能跑长任务
发布于评测任务慢且会失败,状态机比热闹架构更重要。
Agent Skills 最佳实践:从评测、结构拆分到安全审查
发布于好 Skill 先从失败样本长出来,再谈结构和安全。
Agent 评测工程化(七):从评分报表到 PM 决策工作台
发布于报告不是字段展示,而是把评测结果翻译成决策路径。
AI Native 不是工具升级,而是组织重写
发布于数用了多少 AI 功能没有意义,要看多少流程被倒逼着重新定义。
Agent Skills 设计模式:用文件夹给 Agent 装上专业能力
发布于能力不是塞进上下文,而是按任务被唤醒。
DeepSeek Harness:把 Agent 宿主变成可组合的基础设施,企业能拿它做什么
发布于Agent = Model + Harness,难的不是模型,是把它接进真实环境。
AI 背下了所有关于猫的知识,却没摸过一只猫
发布于AI 只有数据,人有体验,这是最后的护城河。
Anthropic 发布 Agent Skills:AI Agent 的能力该如何被打包
发布于把能力打包成文件夹,Agent 才能按需调用。
MCP 2026-07-28 改了什么:从有状态会话到无状态核心
发布于无状态之后,MCP Server 也能像 Web API 一样扩展。
SEO 之后是 GEO:当搜索变成「跟 AI 对话」,品牌怎么被看见
发布于用户不问搜索引擎了,他们直接问 AI 哪个好。
Agent 评测工程化(六):评测前,先把 Agent 输出拆开
发布于评测前先看懂答案,否则分数只是误读的结果。
Agent 评测工程化(五):让 LLM-as-judge 稳定输出结构化结果
发布于模型负责判断语义,系统负责守住协议边界。
Agent 评测工程化(四):红线、一票否决与 1-5 分
发布于分数只有能回到规则,才有讨论和修复的空间。
企业 AI 落地:先问 Why/What/How,再谈规模化
发布于八成试点死在流程上,小处着手才是活路。
Agent 评测工程化(三):从低分样本到问题簇
发布于单条 badcase 只能讨论,问题簇才能进入排期。
Agent 评测工程化(二):Rubric 不是 Prompt,而是可执行的质量协议
发布于Rubric 不是更长的 prompt,而是系统可执行的质量协议。
Agent 评测工程化(一):为什么不能只看平均分
发布于平均分回答不了红线,也推不动下一次修复。
AI 是不是泡沫,根本不重要
发布于互联网泡沫没挡住互联网,AI 泡沫也挡不住 AI。
企业 AI 推不动的四个认知误区:降本、技术、底座与数据
发布于把 AI 当裁员工具的那天,落地就已经输了。
AI Agent:从工具到同事,中间隔着一层「自主性」
发布于工具听指令,Agent 接目标,差距就在这层自主性。
企业 AI 落地的成熟度分层:L1 到 L4,你的组织在哪一层
发布于用上 AI 工具不等于 AI 化,L1 到 L2 才是真正的分水岭。
走向 AI Native:原生 AI 产品与垂直壁垒,企业转型的终点
发布于越通用越没用,越垂直越有壁垒,这就是 AI Native 的护城河。
AI 组织转型:为什么「全员用 AI」和「通用方案」都是陷阱
发布于局部最优往往导致整体更差,端到端流程的流动性才是组织转型的关键。
Agent 刚才干了什么:审计、调用日志与敏感数据豁免
发布于可观测 = 审计 + 调用日志,难的却是决定「不记什么」。
定时是 Agent 平台的另一半:Trigger/Action Registry 与调度原语分层
发布于用户不在场时事情怎么发生,难的不是写一个调度器,是把触发和动作真正拆开。
一个系统,两种访客:给浏览器和 Agent 设计同一套身份体系
发布于认证方式只是请求的属性,Agent 多了,并不等于系统要裂成两半。
精选数据与垂直 AI:AI 时代的护城河在哪
发布于数据从「越多越好」到「越准越好」,垂直才是护城河。
生态 > 模型:大模型竞争的本质不是模型本身
发布于模型都在互相抄,真正拉开差距的是生态。
给生产 Agent 做体检(六):从诊断明细到 PM 能用的报告——评估结果的产品化
发布于信息架构本身就是产品决策,没有叙事主线就没有结论。
给生产 Agent 做体检(五):不要消息队列——基于数据库的任务编排与可靠性
发布于队列不必独立部署,数据库的原子领取已足够可靠。
给生产 Agent 做体检(四):LLM 输出不完美怎么办——归一化、一次修复与失败隔离
发布于一条坏行止步于自己,一次修复就足够。
给生产 Agent 做体检(三):让 LLM 稳定输出结构化诊断——严格 JSON Schema 实践
发布于协议不在 prompt 里祈祷,而在 Schema 里强制。
给生产 Agent 做体检(二):诊断之前,先定义人口——数据质检与风险筛选
发布于诊断之前先定义人口,规则永远跑在模型前面。
给生产 Agent 做体检(一):只用对话文本的黑盒诊断工作流
发布于拿不到链路日志时,对话文本本身就是诊断的全部。
单点跑通之后,怎么把 Agent 能力沉淀成全公司可复用
发布于提示词会被绕过、会失效,会被注入,能挡住的只有写在 Runtime 里的治理。
存量系统 Agent 化,物理上到底怎么「接」
发布于更新于接系统的正确顺序,是先确定要完成什么任务,再倒推系统该暴露什么能力。
把存量系统交给 Agent,先想清楚 API、Skill、MCP 各是什么
发布于存量系统最值钱的资产,从来不是它的接口,而是散落在老员工脑子里那套「使用方法」。
RAG 答非所问?从索引到生成,打通最后一公里
发布于优化加法做得越多,系统离答案未必更近。
RAG 检索不准?先别换模型,把问题问对再说
发布于更新于检索失败,常常不是检索器的错,是问题还没被问对。
企业级 RAG 怎么落地?不只是向量检索和大模型(附完整源码)
发布于RAG 的上限不在模型,在知识能不能被持续维护。
RAG 为什么回答流程问题会漏步骤?原因和改进方案(附完整源码)
发布于更新于召回的片段相关,不等于还原的路径完整。
RAG 实战:核心组件、调优与问题排查
发布于更新于五大组件不是答案,让它们彼此可评测才是。
RAG 核心原理:检索、向量与嵌入——计算机如何理解语义
发布于把世界变成数字,距离就是意义本身。
RAG 入门:为什么大模型需要查资料再回答
发布于更新于大模型是闭卷学霸,RAG 是给它配了一台联网电脑。
Prompt Engineering 高阶技巧与全景总结
发布于更新于让模型自己审自己,能补上表达的粗糙,补不上它原本就有的盲点。
复杂任务拆解:像项目经理一样驾驭 AI
发布于更新于你的角色从执行者换成了指挥者,返工的代价也从整个项目缩到一步。
思维树(ToT):从线性推理到多分支探索
发布于更新于一条路走到底最省钱,代价是永远不知道岔路口另一边有什么。
思维链(CoT):让 AI 学会一步步思考
发布于更新于写出来的步骤是给人看的说明,不是模型内部真实的思考轨迹。
做 AI 助手,最怕一上来就建知识库
发布于先让业务值得做,再让基建把它做稳。
Prompt 实用技巧与趣味实践:分隔符、条件检查与分步指令
发布于更新于分隔符划的是任务边界,不是安全边界,两者千万别混为一谈。
提示词安全攻防全解析:越狱、注入与信息泄露
发布于更新于提示词只能表达意图,守不住底线,真正的权限边界在服务端。
零样本与少样本提示:AI 提示的两大基础技巧
发布于解释半天不如打个样,范例本身就是最短的规范说明书。
Prompt Engineering 入门:与 AI 高效协作的第一课
发布于模型答得含糊,多半是因为提问的人自己还没想清楚。
LLM 工作原理(四):延迟、成本与幻觉——工程落地三大挑战
发布于更新于能跑通的 Demo 和能上线的系统之间,隔着延迟、账单和一本正经的胡说。
LLM 工作原理(三):推理与采样策略——AI 如何选择下一个词
发布于更新于模型只给出概率,严谨还是天马行空,是采样那一刻替它决定的。
LLM 工作原理(二):Transformer 与自注意力机制
发布于更新于注意力就是一切,剩下的只是让每个词自己去找同伴。
LLM 工作原理(一):从预测下一个字开始
发布于更新于它没有在查答案,它只是在猜下一个字,而智能从这场猜谜里涌现出来。
React 核心(17):TanStack Query 缓存机制详解
发布于先展示旧的,悄悄换成新的,这就是 SWR。
React 核心(16):TanStack Query 入门指南
发布于服务器状态不是变量,是有保鲜期的存货。
React 核心(15):Suspense 机制详解
发布于更新于等待本身也是一种渲染,Suspense 让它长得不像等待。
CSS 基础(七):响应式设计与媒体查询
发布于更新于响应式不是为每个屏幕写一套 HTML,而是让一套 HTML 自动换衣服。
CSS 基础(六):Grid 网格布局
发布于更新于横竖都要管的时候,Grid 把元素放进坐标系,而不是队列。
CSS 基础(五):Flex 弹性布局
发布于一行里,谁先谁后、谁胖谁瘦、谁贴边谁居中。
CSS 基础(四):定位
发布于定位的本质是「我从哪里出发」,起点不同,世界就不同。
CSS 基础(三):浮动
发布于浮动不是被设计出来的布局,是给文字让路的临时工。
CSS 基础(二):盒模型
发布于盒子算不对,多半不是数学问题,是「宽」到底从哪里算起。
CSS 基础(一):元素类型与 display 属性
发布于你以为标签天生是谁,只是浏览器替你穿上了衣服。
VitePress 动态渲染全栈落地方案
发布于更新于把构建期内容推到运行时,代价是 SEO,但赢回的是改库即生效。
AI 驱动动态看板架构指南
发布于更新于AI 只管决策与翻译,渲染必须攥在组件手里。
Vercel AI SDK 自定义 OpenAI 模型接入
发布于更新于只要一个协议长成 OpenAI,模型就不再被厂商绑死。
Web 多主题架构最佳实践
发布于更新于组件只该知道这是 Primary,不必知道今天是蓝色还是紫色。
CORS 与 Web 安全实战白皮书
发布于更新于CORS 守住的是「读」,却放过了「写」,这才是 CSRF 的真正温床。
Next.js 子域名、反向代理与分享链路最佳实践
发布于更新于子域名项目的稳定,源于主站、租户与回源三套边界永不串台。
设计模式之迭代器模式:不暴露内部实现,顺序访问集合
发布于集合怎么变,与遍历者无关。hasNext 与 next,就是稳定的最小承诺。
设计模式之状态模式:状态变,行为变
发布于同一个对象,换了一种身份,就在做另一件事。
Docker 集群演进史:Swarm → Compose → Kubernetes
发布于Kubernetes 赢在生态,不在功能——谁也控制不了它,于是所有人都愿意押注它。
Docker Compose 多容器编排:从命令到声明式
发布于Compose 的真本事不是编排容器,是把「一段命令」换成「一份意图」。
设计模式之责任链模式:请求逐级传递,动态组合处理者
发布于请求不必知道谁会处理它——只要把单子投出去,链上自有人接。
Maxwell 数据初始化:maxwell-bootstrap 全量同步实践
发布于更新于binlog 装不下历史,全量只能直读表,不写 MySQL 就不放大。
Docker 数据持久化与网络:Volume 与容器间通信
发布于容器可以死得很轻,数据必须活得很重,这是卷与网络存在的全部理由。
Docker 核心概念与安装:镜像、容器、仓库、Dockerfile
发布于镜像是不可变的类,容器是一次性的对象——要改就改类,别改对象。
设计模式之观察者模式:一对多依赖,状态变更自动通知
发布于我不知道你是谁,但我知道,你在听。
Docker 入门:为什么容器化是 AI 时代的必备技能
发布于容器化解决的从来不是部署,而是「同一份代码在所有机器上都长一个样」。
设计模式之模板方法模式:固定骨架,可变步骤
发布于父类把流程写死,子类只能填空,这就是反向的控制。
设计模式之适配器模式:让不兼容的接口协同工作
发布于不兼容不是问题,中间加一层翻译就好——适配器是事后补救,不是事先设计。
DDD 复杂业务系统设计(六):领域事件,让“作业提交”自动触发批改进度
发布于领域事件是「已经发生」的事实,不是「将要发生」的命令,而幂等是这条事实的生命线。
TCP 与 UDP:三次握手、四次挥手、SYN 攻击与选型
发布于更新于三次握手为可靠,四次挥手为体面,2MSL 为心安。
设计模式之建造者模式:复杂对象的组装艺术
发布于工厂关心造什么,建造者关心怎么造——同样的零件,组装顺序决定它是台电脑还是台服务器。
DDD 复杂业务系统设计(五):聚合与聚合根,一个“选课单”应该装多少东西
发布于聚合是一致性边界,不是对象的合集,边界之内强一致,之外只靠最终一致。
设计模式之工厂模式:简单工厂、工厂方法与抽象工厂
发布于从 if-else 到产品族,三种工厂在回答一个问题:对象的创建权,到底交给谁。
DDD 复杂业务系统设计(四):实体与值对象,把“学员”和“地址”放进代码的两种姿势
发布于实体回答「我是谁」,值对象回答「我是什么」,身份与描述本就是两件事。
ZooKeeper 原理与实践:数据模型、Watcher 与 ZAB 协议
发布于过半换一致,一次换简洁——ZooKeeper 的设计都写在放弃里。
设计模式之原型模式,及深浅拷贝
发布于更新于克隆不是复制,克隆只是把引用一并交了出去。
Linux 命令大全:SSH 免登录、查找、防火墙与运维必会命令
发布于命令记不住是常态,懂得避开 root 部署,才算真正入门。
软件设计原则:SOLID + KISS / YAGNI / LOD 全景
发布于更新于简单是可靠的前提——Dijkstra
DDD 复杂业务系统设计(三):限界上下文,为什么“课程”在教务和市场是两种东西
发布于脱离上下文的术语毫无意义,「课程」在教务与市场,从来就不是同一种东西。
MySQL 知识系列(六):SQL 注入、版本特性与容量评估
发布于注入的本质,是把数据当成了代码。
Redis 知识系列(三):持久化与高可用
发布于持久化的代价藏在 fork 里,主从的风暴藏在树状层级里。
MySQL 知识系列(五):隔离级别、Spring 事务与查询流程
发布于事务的边界不在数据库里,而在调用它的第一行代码。
Redis 知识系列(二):高效使用
发布于事务只是打包执行,需要原子分支时,把逻辑搬进 Lua。
MySQL 知识系列(四):日志系统:redo log、undo log、binlog
发布于数据库没崩,靠的不是运气,是 redo 先于数据落地。
Redis 知识系列(一):数据结构与单机原理
发布于内存、单线程、多路复用,三件事共同撑住了十万 QPS。
MySQL 知识系列(三):锁机制与并发控制
发布于读不阻塞写的秘密,是把同一行数据悄悄存成了多个版本。