Skip to content
Neo's Blog

Archives

All the articles I've archived.

20264
July4
  • KV Cache:Transformer 推理的「记忆体」

    为什么大模型聊到后来越来越贵?为什么不同模型的推理成本差几十倍?答案藏在 KV Cache 里——这个把 Transformer 从 O(n²) 拯救到 O(n) 的关键机制,如何在 GPU 显存中被高效管理?

  • LLM 重构语音合成:大模型时代的 TTS 范式

    2024年,LLM 开始'接管'语音合成。从 VALL-E 到 GPT-4o Voice,TTS 不再是独立任务,而是大模型多模态能力的一部分。流式合成和全双工对话正在重新定义语音交互的边界。

  • 生产级 AI Agent 的驭手工程:控制面与上下文战场

    从 7 模块控制面到上下文窗口的硬核工程--为什么模型只是引擎,驭手才是底盘和刹车,以及如何管理 LLM 最珍贵的战略资源。

  • TTS 技术全景:从声波到语音

    每天和语音助手对话的你,有没有想过那段声音是怎么从文字变来的?TTS 的三段式 pipeline 藏着声码器的演进密码,而中文 TTS 更是要攻克声调、多音字、分词五大难关。