Tag: self-attention
All the articles with the tag "self-attention".
从 Transformer 到 Mamba:LLM 的底层原理与下一代架构
GPT、Claude、DeepSeek 为什么底层架构如出一辙?Transformer 的 Self-Attention 如何工作?为什么 LLM 只能逐字生成?Mamba 能否替代 Transformer?本文从原理到工程,拆解 LLM 的核心机制与演进方向。
All the articles with the tag "self-attention".
GPT、Claude、DeepSeek 为什么底层架构如出一辙?Transformer 的 Self-Attention 如何工作?为什么 LLM 只能逐字生成?Mamba 能否替代 Transformer?本文从原理到工程,拆解 LLM 的核心机制与演进方向。