专题
从一个问题开始,沿着主题连续阅读。
Agent 的运行机制
从运行循环、真实会话到记忆机制,串起 Agent 如何工作。
- Agent 学习记录 1.0:Agent Loop
从 AI Agent 的基本组成、ReAct 和 Codex Agent Loop 入手,整理我对 Agent 运行机制的阶段性理解。
- Agent 学习记录 1.5:Codex 会话记录分析
阅读一次真实 Codex Desktop 会话 JSONL,按模型上下文线和 Runtime 事件线理解 Agent Loop 的运行细节。
- Agent 学习记录 2.0:Agent Memory 机制与产品设计
整理 Agent Memory 的目标、生命周期与治理能力,并对比 Claude Code、Codex 和 Hermes 的 memory 设计。
模型训练与推理
从 Transformer 和梯度更新开始,再看微调、量化与推理优化。
- Transformer 学习记录
基于 llama2.c 的 run.c 源码注释,梳理 Decoder-only Transformer 的推理流程、RoPE、Attention、FFN、采样和 BPE。
- 反向传播(Backpropagation)学习笔记
整理反向传播的 Loss、梯度、链式法则、优化器更新,以及 LLM 训练中常见的显存优化方法。
- LoRA 学习笔记
整理 LoRA 的低秩适配原理、训练与推理流程、常见插入位置、核心超参数,以及 QLoRA、AdaLoRA、DoRA 等变体。
- GGUF与量化
从 GGUF 文件结构、内存映射、张量卸载和量化格式入手,整理本地大模型文件与推理优化的基础概念。
- DSpark
从 speculative decoding 的验证机制讲起,整理 DeepSeek DSpark 在 draft 和 verify 两个阶段的关键改动。
论文与技术阅读
带着具体问题读论文,记录方法、演进和自己的理解。
- DeepSeek 系列笔记:从 V2 到 V4 的训练与架构
按版本整理 DeepSeek V2—V4 的架构与训练变化,比较 MLA、MoE、多 Token 预测等方法解决的问题与取舍。
- LLM Offloading 与 Fate 论文
记录 Fate 论文对 LLM Offloading 的观察,以及 MoE 卸载领域的几个主流方向。
- BAIT:面向大语言模型的后门扫描
整理 BAIT 如何通过反演攻击目标扫描大语言模型后门,附论文组会汇报与逐页讲解材料。
- RAG
整理 RAG 的核心思路、离线索引与在线问答流程,以及 Retrieval-Augmented Generation 论文中的检索器和生成器架构。