Skip to content

AI 原生架构师笔记 · 系列导览

技术栈:LLM 应用工程 / Prompt Engineering / RAG / Agent / LLMOps 适用场景:当你要把大模型从「能跑通的 Demo」做成「可靠、便宜、快、安全的生产系统」时,本系列提供一份卡片式的架构速查。

大模型 API 调用只需三行代码,但把它变成经得起海量用户考验的产品,中间隔着一整套工程方法论:如何在概率组件上构建确定性系统、如何在成本/延迟/质量之间取舍、RAG 检索链路如何逐层优化、Agent 如何规划与协作、上线后如何做 LLMOps。本系列共 43 篇,按认知、提示工程、RAG、Agent、LLMOps 五个板块组织,每篇聚焦一个主题,可按需跳读。

开篇三篇由认知层的多篇短文合并压缩而成,建立全局框架;其后 40 篇为专题速查,覆盖从提示工程到工程化基础设施的完整链路。

一、认知与决策(合并综述)

序号文章讲什么
01范式转变:AI原生应用与不确定性编程开发者角色三次跃迁、AI-Native 判定标准、概率系统的四种确定性架构模式
02Token经济学与模型路由成本/延迟/质量的不可能三角、三种路由策略、AI 全栈技能地图
03从Demo到生产Prompt as Code、数据飞轮闭环、隐私三模式、上线前七条检查清单

二、提示工程进阶

序号文章
04结构化输出:JSON Mode 与 Function Calling 重塑接口设计
05思维链变体:ToT 与 GoT 的工程实现
06动态 Few-Shot:基于语义相似度检索示例
07元提示:让大模型自己优化 Prompt
08DSPy 框架:用编程方式编译和优化 LLM 调用
09防御性 Prompt 设计:对抗 Injection 与 Jailbreak
10角色设定卡:提升模型的情商与专业度
11长上下文陷阱:Lost in the Middle 及应对策略
12Prompt 评估体系:构建自动化测试集
13多模态 Prompting:图文混合输入实践与调优

三、RAG 架构演进

序号文章
14长上下文会取代 RAG 吗:辩证分析
15高级分块策略:语义分割、父子索引与多级检索
16混合检索:BM25 与向量检索的加权融合
17重排序:Cross-Encoder 作为 RAG 的精准过滤器
18GraphRAG 实战:知识图谱增强跨文档推理
19查询重写:HyDE 与多查询分解
20Self-RAG 架构:按需检索与自我修正
21RAPTOR 索引:递归树状索引提升长文档全局理解
22多模态 RAG:索引 PDF 中的表格、图表与图片
23RAG 评测:Ragas 与 TruLens 实践

四、Agent 智能体

序号文章
24Agent 架构通识:从 ReAct 到 Plan-and-Solve
25工具使用设计模式:为 LLM 定义清晰鲁棒的 API
26多智能体协作:AutoGen 与 CrewAI 的角色分工
27记忆系统:短期记忆、长期记忆与反射机制
28规划能力:任务拆解与依赖管理
29自主编码 Agent:Devin 与开源替代的技术原理
30浏览器自动化 Agent:基于 Playwright 的 WebAgent
31人机回环:Agent 关键操作的人工确认设计
32Agent 调试与监控:LangSmith 追踪思考过程与调用链
33具身智能:将 Agent 接入物理世界

五、LLMOps 与工程化基础设施

序号文章
34LLM 网关设计:API Key、限流、缓存与故障转移
35向量数据库选型:Milvus、Pinecone、Weaviate 与 pgvector
36评估驱动开发:以 Evals 为核心的开发流水线
37合成数据工程:用大模型生成训练与评测数据
38微调 Ops:LoRA 适配器的版本管理与快速切换
39推理加速:KV Cache 优化与投机采样
40流式输出实践:SSE 协议与 Markdown 增量渲染
41AI 应用安全防护:PII 过滤与内容审核
42无服务器 AI:Vercel AI SDK 与 Cloudflare Workers
43私有化部署 ROI:何时切换到自托管 Llama 3

阅读建议

  • 想建立全局认知:先读 01~03 三篇综述,理解范式、成本模型与生产落地全景。
  • 在做 RAG / Agent:直接跳到第三、四板块,每篇独立成文,可当查手册用。
  • 准备上生产:重点看 03 的七条检查清单,以及第五板块的网关、评估、安全三篇。