做 RAG、做知识库的人,都逃不开一个执念:数据越多越好。 但这个执念值得好好拆一拆——数据的关键从来不是”量”,而是”质”。
原始数据的幻觉
过去大家普遍有个朴素的想法:把原始数据一股脑收集起来,生成式 AI 自然会帮你整理好一切。
这个想法在早期或许还能凑合,但越往后越不成立。现实很直接:如果只是堆原始数据,AI 会带来幻觉、带来试错成本。 真正要让数据产生价值,必须换一种方式训练模型——也就是”精选数据”(curated data)。
什么是精选数据?一句话:更干净、可信、目标明确的数据集。 不只是把数据拿过来,还要用正确的方式、正确的格式去准备它。
这和我在 RAG 实践里的体会完全一致。知识库塞一百份泛泛的资料,不如一份精准贴合业务流程的知识有用。数据治理做得差,检索召回的段落再多,也答不对问题。
精选数据的三条纪律
企业做精选数据的方法论,可以归纳成三条:
第一,让每个业务单元拥有自己的数据。 数据在哪里产生,就由哪个团队负责,并准备好供 AI 分析。不能指望一个中央部门替你整理好所有数据。
第二,持续做数据生成检查。 要核查数据是否真的来自自家的工厂、员工、配送、供应链——源头对不对,直接决定数据能不能信。
第三,把隐私和合规内置进数据集。 从创建数据集的那一刻起,就要明确这些数据只用于 AI 的目的,防止被滥用或未授权访问。
这三条的底层逻辑是一样的:数据不是”有多少”,而是”能不能被可信地调用”。
数据共享最难的从来不是技术
还有一个容易被忽略的点:数据共享里,最难的永远不是技术,而是共赢的合作模式。
权限怎么定、业务关系怎么设计、补偿机制怎么算——这些非技术问题,比”技术上怎么打通”复杂得多。即便在公司内部,不同部门的数据也常常是孤岛。很多人根本没意识到,自己公司里已经有大量可用的数据,只是散落在各部门、没被盘活。
所以给企业的建议是:先梳理内部各部门的数据需求,明确哪些数据真正能带来价值,再解决访问权限。 数据量不是越多越好,准确、有目标才重要。
还有一个更主动的思路:聪明的公司会把每一次客户互动都当作创造价值的过程。 你接触客户,就能创造更多数据。把关系维护好、把服务做好,客户才愿意把数据作为回报交给你。数据不一定客观缺失,很多时候只是你还没创造性地去想”它在哪”。
垂直 AI:最开放的赛道
有了精选数据,下一步就是垂直 AI。这是目前最开放、机会最多的赛道,尤其在中国。
逻辑很朴素:无论中国还是全球,每个行业都不可避免地要用 AI,这是大趋势。但通用大模型已经被巨头把持,创业者和企业真正的机会,在于扎根一个具体行业,解决这个行业的具体问题。
对投资者来说,他们关注的是”哪个垂直领域、哪家公司能在这个赛道创造更大价值”——能不能深入一个拥有 AI 的行业、解决它的真实问题,是决定性的。
对企业来说,这句话同样成立。我在讲组织转型时反复强调过一句话:越通用,越没用;越垂直,越有护城河。 你越通用,就越接近大模型本身,而你在通用性上永远赢不过大模型。真正能建立壁垒的,是你手里的领域知识、场景数据,以及把这些沉淀下来的能力。
一句话总结
大模型把”智能”变成了通用品,真正的稀缺品变成了”数据”和”场景”。数据要从”越多越好”转向”越准越好”,能力要从”通用”转向”垂直”。谁能把精选数据喂进垂直场景,谁就拿到了 AI 时代最硬的那道护城河。