Featured image of post 知识库、Skill 与 Agent、数据集、微调模型:LLM 落地的五层底座

知识库、Skill 与 Agent、数据集、微调模型:LLM 落地的五层底座

这几个词总是被一起提起,因为它们其实是 LLM 应用落地的五层:知识、技能、智能体、数据、模型。逐层讲清楚是什么、解决什么问题、商业价值在哪。

为什么这几个词总被放在一起

做 AI 应用这几年,我反复被问到一组概念:知识库、Skill Agent、数据集、微调模型。它们经常出现在同一份方案里,但很少有人把关系讲清楚。

我自己的理解是:它们是 LLM 从"通用"走向"懂你的"的底座,一共五层。

  • 知识库:让模型"知道"你的私有数据
  • Skill(技能):让模型"会做"专业任务,封装专家方法论
  • Agent(智能体):让模型"去干",负责规划、调用工具、按需加载技能
  • 数据集:让模型"学到"你的行业养分
  • 微调模型:让模型"变成"你的专属模型

一个企业 LLM 应用从 demo 到生产,绕不开这五件事。我做过数据集管理服务、知识库问答服务,也开源过 Skill/Agent 方向的炼丹炉项目,下面的说法都有真实项目做底,不给数字,只讲逻辑。

一、知识库:让模型"知道"你的私有数据

先说是什么。知识库问答(RAG)是目前最主流的私有数据落地方式:把企业文档、FAQ、数据库内容分块,转成向量存进检索系统;用户提问时,先从库里检索出最相关的片段,连同问题一起交给 LLM 生成回答。模型本身不变,变的是每次问答时喂给它的上下文。

它解决三个问题:一是模型不知道你的私有数据,通用模型没学过你的产品手册和客户案例;二是幻觉,让模型硬答它不知道的东西,它就会编;三是知识时效,文档更新了,检索到新内容,回答就跟着新,不用重训模型。

商业价值上,这是企业 AI 落地第一个值得做的场景,因为 ROI 最清晰:客服问答、内部知识问答、合同/制度检索,都是"原来要人翻文档"的活,现在秒回。知识库的核心资产是数据本身:同样一套 RAG 代码,谁的数据组织得好、分块合理、答案准确率高,谁就有壁垒。做知识库问答服务的经验是:检索质量决定用户体验,而检索质量取决于数据治理,不是模型选型。

二、Skill 与 Agent:让模型"会做"、也"去干"专业任务

先说清楚,Skill 和 Agent 是两个东西。Skill(技能)和 Agent(智能体)经常被捏在一起说,但它们是两个独立的概念、两层独立的资产。

Skill(技能)是什么:把专业任务的方法论封装成结构化技能包(心智模型、决策规则、边界、禁忌、示例),一段话说明白"这件事怎么做才算专业"。我在炼丹炉里做的"金丹"就是这个:把人格特质和表达方式封装成技能包,一颗金丹就是一套完整的专业行为规范。

Agent(智能体)是什么:执行体。能规划、能调用工具、能多步推理,按需加载技能去完成任务。炼丹炉里的"道人"就是这个:道人服用金丹后,行为就被技能"化"了。关键设计是技能与执行体解耦:一个道人可以服用多颗金丹(多个技能),一颗金丹可以被多个道人复用。

解决的是专业任务的自动化。通用 Agent 是"全能而不专业"的:让它做医生问诊、做风控审核,它没有专家级的行为规范。技能解决"专业":行为准则、停止条件、评判标准;Agent 解决"执行":规划、工具调用、多步推理。两者分开,技能才能沉淀、复用、版本化,Agent 才能轻装、按需加载、随时被替换。

商业价值上,技能是可复制的专家经验:资深员工的行为准则封装进技能包,人走了经验还在,一个高级顾问的产出可以规模化。Agent 是执行通道:任务边界写清楚之后,执行可以交给便宜的模型(这就是我上一篇写的模型分级)。当前 AI 应用差异化竞争的主战场在技能层:模型的差距在缩小,技能的差距在拉大。

三、数据集:让模型"学到"你的行业养分

再看是什么。数据集是训练、微调、评测模型的数据资产:指令对(问题-标准答案)、对话对(多轮对话)、评测集(有标准答案的验收用例)。数据集管理平台负责数据的采集、清洗、标注、版本管理、评测。我做的数据集管理服务就是这个方向,本质上是数据资产的仓库和流水线。

解决什么问题?一个被低估的事实:模型质量的天花板是数据,不是模型。同样一个底座模型,喂什么数据决定它是什么水平的模型。指令数据的质量决定对齐质量,评测集决定你能不能客观知道"模型到底行不行",没有评测集,改进就是凭感觉。企业里大量 AI 项目死在数据上:格式不统一、标注不一致、缺评测标准。

商业价值:数据是 AI 时代的石油这句话被说烂了,但逻辑是真的:标注产业、数据治理平台、合成数据,都是实打实的市场。对企业来说,数据集是资产不是成本:同样的模型,谁的指令数据更高质量,谁的微调效果就更好;评测集就是验收标准,是甲乙方博弈的锚点。数据合规(来源可追溯、权限可管控)本身就是商业价值:数据资产化的前提是数据可信。

四、微调模型:让模型"变成"你的专属模型

最后是微调。它是在通用模型基础上,用领域数据继续训练(LoRA 等参数高效方法是主流),让模型把业务能力"内化"到参数里。它和 RAG 的本质区别:RAG 是每次问答临时注入知识,微调是把能力写进模型本身。

解决什么问题?RAG 管"知道什么",微调管"怎么说话、按谁的规矩办事":固定的输出格式(结构化 JSON、特定语气)、专业术语的准确使用、企业内部的表达习惯。微调还能解决 RAG 治不好的问题:模型能力本身不够时(比如让小模型学会复杂指令),注入再多上下文也没用。

商业价值上,三个场景最典型:一是垂直行业模型,医疗、法律、金融,同样的底座,行业数据微调后就是行业模型;二是私有化部署,合规要求数据不出域,小模型微调后本地跑,效果接近大模型;三是长期成本,微调让一个便宜的小模型达到通用大模型的效果,每 token 成本降一个数量级。什么时候微调是商业决策的关键:数据量不足时微调不如 RAG,数据积累够了再微调,收益陡增。

五层怎么配合

我常跟人画一张图:

LLM 落地的五层底座

企业落地路径也基本是固定的:先用知识库快速见效,一两个月就能上线;过程中顺手积累数据(问答记录、反馈、评测集);然后把专业流程封装成技能,从能回答走到能办事;数据攒够了再微调,把能力从"借来的"变成"自己的"。

这几个词不是并列的技术名词,是一条递进的路。模型的通用能力是人人平等的起跑线,知识、技能、执行体、数据、专属模型,才是企业拉开差距的底座。这也解释了为什么 AI 应用做深了,最后都变成数据生意和知识管理生意。

封面图:Grand Canyon NPS / Flickr · CC BY 2.0

Built with Hugo
Theme Stack designed by Jimmy