深度专题
从原理到可复现实践
围绕 Java 运行时、低成本大模型推理和 Agent 工程,按学习顺序整理已有文章。
Java 运行时与生产诊断
9 篇 · 代表文章:从 ASM 到 ByteKit 再到 Arthas从类加载、Java Agent 和 Javassist 进入字节码增强,最后串联到 ByteKit 与 Arthas。
- Java 类加载机制详解(一):加载、验证、准备、解析与初始化 建立类生命周期的整体认识
- Java 类加载机制详解(二):类加载器、双亲委派及其破坏 理解类加载器层级与双亲委派
- Java 类加载器复习:Bootstrap、Extension 与 AppClassLoader 用代码观察不同类加载器
- Java Agent 入门:premain、Instrumentation 与 Javassist 方法增强 构建第一个可运行的 Agent
- Java Agent 实战:读取方法参数名并插入观测代码 从挂载 Agent 进入方法观测
- Javassist 入门:动态创建类、字段、构造函数与方法 熟悉 Javassist 的核心 API
- Javassist 方法增强:使用 insertBefore/insertAfter 记录入参与返回值 实现方法前后的字节码织入
- Javassist 注解解析:读取运行时类注解信息 从字节码中读取注解元数据
- 从 ASM 到 ByteKit 再到 Arthas:一条 Java 字节码增强链路 串联底层 API、增强框架与诊断工具
低成本大模型推理
8 篇 · 代表文章:8GB 显存运行 35B MoE 模型从本地部署、量化和 KV Cache 参数入手,逐步理解显存占用、GPU Offload 与 MoE 专家缓存。
- Ollama 本地运行 Gemma:安装、模型选择与性能体验 用最低门槛建立本地推理环境
- 使用 LM Studio 本地部署 DeepSeek-R1 蒸馏模型 通过桌面工具理解模型加载
- HNSW 算法原理详解:分层图构建、搜索流程与参数调优 补齐 RAG 向量检索基础
- GPT-OSS 模型架构与 20B 本地运行体验 理解 MoE 架构和本地资源需求
- 6GB 显存加速 GPT-OSS 20B:GPU Offload 层数与速度实测 观察部分层卸载带来的性能变化
- RTX 5060 Ti 16GB 运行 GPT-OSS:与 RTX 3060 的性能对比 对比不同显存配置的实际表现
- 6GB 显存运行 64K 上下文:llama.cpp 参数与 KV Cache 调优 调整上下文、缓存量化与 GPU 层数
- 8GB 显存如何跑 35B:FreeToken 的专家缓存与 CPU-GPU 协同 深入 MoE 专家缓存和异构卸载
Agent 工程实践
4 篇 · 代表文章:Claude Code 实现原理从 Agent 开发框架和工具系统出发,理解循环、上下文、工具调用、Subagent 与 MCP 的工程实现。
- Google Agent Development Kit Java 入门:环境搭建与首个 Agent 用 Java 建立 Agent 开发环境
- Claude Code 实现原理:Agent 循环、工具调用、Subagent 与 MCP 理解成熟编码 Agent 的核心结构
- 使用 Xiaomi MiMo API 运行 Hermes Agent 配置模型、Gateway 与长上下文
- Pi Agent 工具系统:Read、Write、Edit 与 Bash 的实现原理 拆解文件工具和命令执行链路