flowchart LRInput[输入文本] --> Token[Token化]Token --> Embed[嵌入向量]Embed --> Transformer[Transformer 处理]Transformer --> Prob[概率分布]Prob --> Decode[解码生成]Decode --> Output[输出文本]
概念解释:

flowchart TBInput[输入Token] --> Embedding[词嵌入]Embedding --> Positional[位置编码]Positional --> Attention[自注意力层]Attention --> FFN[前馈神经网络]FFN --> Norm[层归一化]Norm --> Output[输出概率]
概念解释:
Transformer 以自注意力机制为核心。模型处理任意 Token 时,可以同时参照输入里其他位置的 Token,借此理解上下文关联。由于自注意力自身无法感知顺序,还需要通过位置编码补充序列的先后信息。
mindmaproot((LLM核心能力))自然语言理解意图识别情感分析实体提取自然语言生成文本创作翻译总结推理能力逻辑推理代码生成数学计算上下文学习多轮对话少样本学习角色一致
概念解释:
LLM 不仅能理解语言,还能生成、推理和学习。上下文学习能力让它可以通过少量示例快速适应新任务,这也是 Prompt Engineering 有效的原因。
sequenceDiagramparticipant U as 用户participant App as 前端应用participant API as 后端APIparticipant LLM as LLM服务participant Cache as 缓存U->>App: 输入问题App->>API: 发送请求API->>Cache: 检查缓存alt 缓存未命中API->>LLM: 调用 chat.completions.createLLM-->>API: 返回生成结果API->>Cache: 写入缓存endAPI-->>App: 返回回答App-->>U: 展示结果
概念解释:
在生产环境里,前端不会直接调用 LLM,而要经过后端袋里。认证、限流、缓存和日志可由后端集中处理,既能防止 API 密钥暴露,也可减少调用成本。
flowchart LRRole[角色定义] --> Context[上下文背景]Context --> Instruction[具体指令]Instruction --> Example[示例]Example --> Constraint[约束条件]Constraint --> Output[输出格式]
概念解释:
高质量的 Prompt 通常包含五个要素:角色定义让模型知道以什么身份回答;上下文提供背景;指令明确任务;示例展示期望输出;约束条件控制输出长度、格式和风格。
flowchart TDStart[选择LLM] --> Task{任务类型}Task -->|复杂推理/代码| OpenAI[GPT-4 / GPT-4o]Task -->|长文本/安全/分析| Claude[Claude-3 系列]Task -->|多模态/成本敏感| Gemini[Gemini Pro]Task -->|私有化/合规| Local[开源模型]Task -->|简单任务/低成本| Turbo[GPT-3.5 / Haiku]
概念解释:
各类模型都有自身优势。选型时应综合衡量任务复杂度、上下文长度、成本、安全合规及多模态需求;对于简单任务,采用轻量模型能够显著降低成本。
flowchart TBsubgraph Direct[直接调用]D1[前端] --> D2[LLM API]endsubgraph Proxy[后端袋里调用]P1[前端] --> P2[后端API]P2 --> P3[LLM API]endstyle Proxy fill:#d4edda,stroke:#28a745
概念解释:
直接调用虽然简单,却会使 API 密钥暴露在前端,存在安全问题。生产环境通常采用后端袋里,由服务端统一保管密钥、监测用量,并完成缓存和限流。