LLM / Agent 经验2026年9月2日·1 分钟KV Cache 为什么能加速推理?一个自注意力视角从 Transformer 自注意力公式推导 KV Cache 的保存对象与显存权衡。#LLM#推理优化#Transformer
LLM / Agent 经验2026年8月26日·1 分钟把 Agent 工具循环调稳:一次『循环卡死』的工程复盘从超时、幂等、结构化输出三个维度整理多轮工具调用的工程化要点。#Agent#工具调用#可靠性