DeepSeek 系列笔记:从 V2 到 V4 的训练与架构

约 11 分钟 浏览

ds 论文记录(v2-v4)

BAIT:面向大语言模型的后门扫描

约 2 分钟 浏览

BAIT 论文组会汇报。

grok4.5初体验

约 1 分钟 浏览

昨晚到今天初步体验了 grok4.5,感觉很好用,grok build 也还挺好用。

AI 时代的思维框架读后小记

约 1 分钟 浏览

记录一个关于推理与训练的地形类比:模型参数像初始地形,prompt 影响局部路径,训练则在长期上塑造地貌与变化规则。

DSpark

约 4 分钟 浏览

从 speculative decoding 的验证机制讲起,整理 DeepSeek DSpark 在 draft 和 verify 两个阶段的关键改动。

agent.qq.com 邮箱

约 1 分钟 浏览

对腾讯 agent.qq.com 邮箱的一点产品观察:Agent-first mail 的身份、分发方式、邮箱能力,以及目前看起来还差一点的地方。

RAG

约 1 分钟 浏览

整理 RAG 的核心思路、离线索引与在线问答流程,以及 Retrieval-Augmented Generation 论文中的检索器和生成器架构。

反向传播(Backpropagation)学习笔记

约 2 分钟 浏览

整理反向传播的 Loss、梯度、链式法则、优化器更新,以及 LLM 训练中常见的显存优化方法。

长上下文退化

约 1 分钟 浏览

整理长上下文退化的含义、位置偏置、长距离泛化、训练分布、检索与推理差异,以及 Agent 场景中的 context rot。

Agent 学习记录 2.0:Agent Memory 机制与产品设计

约 5 分钟 浏览

整理 Agent Memory 的目标、生命周期与治理能力,并对比 Claude Code、Codex 和 Hermes 的 memory 设计。

LoRA 学习笔记

约 2 分钟 浏览

整理 LoRA 的低秩适配原理、训练与推理流程、常见插入位置、核心超参数,以及 QLoRA、AdaLoRA、DoRA 等变体。

Agent 学习记录 1.5:Codex 会话记录分析

约 7 分钟 浏览

阅读一次真实 Codex Desktop 会话 JSONL,按模型上下文线和 Runtime 事件线理解 Agent Loop 的运行细节。

Agent 学习记录 1.0:Agent Loop

约 2 分钟 浏览

从 AI Agent 的基本组成、ReAct 和 Codex Agent Loop 入手,整理我对 Agent 运行机制的阶段性理解。

今天写了一个skill

约 1 分钟 浏览

记录 page-annotator 的想法、标注交互设计和模型测试过程。

GGUF与量化

约 4 分钟 浏览

从 GGUF 文件结构、内存映射、张量卸载和量化格式入手,整理本地大模型文件与推理优化的基础概念。

今日拔了一颗智齿

约 1 分钟 浏览

记录一次拔智齿和校医院报销体验。

Transformer 学习记录

约 16 分钟 浏览

基于 llama2.c 的 run.c 源码注释,梳理 Decoder-only Transformer 的推理流程、RoPE、Attention、FFN、采样和 BPE。

博客重新开始

约 1 分钟 浏览

很久之前就想弄博客,现在把这里重新整理起来,继续记录技术和生活。