AI 基础知识
(1)基础知识
云原生工程师视角下的ai大模型能力及其工程范式
API调用层,调用云端或本地模型服务,SDK集成或REST调用
prompt层,通过提示词工程设置模型行为,promptops或模板化上下文
RAG层,让模型具备检索上下文感知能力,向量数据库或embedding管理
agent层,具备构建决策与执行能力的智能体,工具编排或mcp协议
infra层,提供底座支撑:调度,监控,安全与交付,k8s,Aiops,Ai gateway
从大模型到工具执行层的完整协作链路
llm是语言理解与生成核心,提供推理规划生成结构化输出的基础智能能力
rag知识增强层,为模型提供企业知识,外部外部文档,动态上下文,长文本
agent执行与决策层,负责任务分解工具调用,计划与动作执行,可多agent协作完成
mcp模型上下文协议,负责访问外部资源
al gateway 负责请求路由鉴权,审计监控多模型切换,
大模型负责思考,rag负责填充知识,agent负责行动,gateway负责系统治理
(2)大模型工作原理
大模型训练与推理
训练是模型成长阶段,推理是模型根据知识解决问题过程,推理质量依赖于训练结果,微调是训练的延伸,在预训练模型基础上使用特定数据训练,以增强模型在特定方面的推理能力
rag能在不改变模型的情况下,增强回答能力,保证实时性,准确性,
注意力机制
注意力机制依赖于三个向量
query:我现在想找什么
key:我提供了哪些信息
value:我的具体内容是什么
模型在生成每个token时,会把query和历史所有key进行相似度计算,根据权重对所有value加权求和,行程一个注意力分布,
transform架构
多层架构:embedding嵌入层(输入适配器),emcoder编码器,decoder解码器,(两段式处理流水线)output生成输出(智能调度,决定每个token关注哪些信息)
transformer最核心的就是理解那些东西是最重要的和全并行架构
transformer的架构能自动捕捉长距离依赖关系,实现完全平行训练,支持扩展到语音的多模态任务
(3)注意力机制
例:小明告知小红,他把k8s升级到v123了
模型会自动将他指代小明
注意力机制很好地解决了,一步计算全句关系,支持全并行,自动捕捉重要信息,能捕捉远距离关联
多头注意力:多个调度器关注并行工作,关注不同的语法特征,合并整体理解语义,得出的结果更加可靠
(4)k/v缓存
k/v cache就是把历史token的keyvalue缓存下来,解码复用,避免重复计算,这使得llm的速度大大提高,kv缓存是多token下推理能力增强的极大因素,复杂度从On2到On
(5)RLHF人类反馈强化学习
RLHF就像对模型做cicd,循环地对模型做配置检查,优化循环,
评价模型优劣的最好方式是打分,而不是回答
(6)预训练
预训练就是让模型具备对语言,世界知识,逻辑能力,写作风格等底层能力的上限,形成能读,能写,能生成,能推理的基础智能体
预训练的目的就是预测下一个token,
预训练使得模型具备能力,但还不知道规范
(7)微调
微调就使得模型知道规范,随心所欲而不逾矩
微调让模型专一且像你,符合某个领域的特定需求,能做到像一个具备极大量知识的 工程师
(8)模型落地
模型训练的目的不只是获得一个强大的模型,而是建立一套可靠,可扩展,可复现的智能系统生成方式
更多推荐

所有评论(0)