<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>DeepEP on Echo的技术博客</title><link>https://cybersecurityerial.github.io/echo_blog/series/deepep/</link><description>Recent content in DeepEP on Echo的技术博客</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Tue, 28 Jul 2026 17:08:27 +0800</lastBuildDate><atom:link href="https://cybersecurityerial.github.io/echo_blog/series/deepep/index.xml" rel="self" type="application/rss+xml"/><item><title>LLM System: DeepEP v2 弹性通信架构图解</title><link>https://cybersecurityerial.github.io/echo_blog/posts/llm-system-deepep-v2-elastic-communication-design/</link><pubDate>Tue, 28 Jul 2026 17:08:27 +0800</pubDate><guid>https://cybersecurityerial.github.io/echo_blog/posts/llm-system-deepep-v2-elastic-communication-design/</guid><description>&lt;blockquote&gt;
&lt;p&gt;这篇笔记把 DeepEP v2 的对象、内存、同步和数据路径压缩成五张结构图。正文只补充图中不适合展开的语义边界。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2 id="架构总览"&gt;架构总览&lt;/h2&gt;
&lt;p&gt;&lt;img alt="DeepEP v2 弹性通信架构总览" loading="lazy" src="https://cybersecurityerial.github.io/echo_blog/images/llm-system-deepep-v2-elastic-communication/01-architecture-overview.png"&gt;&lt;/p&gt;
&lt;p&gt;&lt;code&gt;ElasticBuffer&lt;/code&gt; 管理 Dispatch / Combine 所需的通信与 Buffer 资源；&lt;code&gt;EPHandle&lt;/code&gt; 保存一次 EP 数据传输的元数据，包括确定性模式、Dispatch 缓存和 GroupGEMM 的 Token Padding 信息。&lt;/p&gt;
&lt;h2 id="elasticbuffer物理分段虚拟连续"&gt;ElasticBuffer：物理分段，虚拟连续&lt;/h2&gt;
&lt;p&gt;&lt;img alt="ElasticBuffer 混合内存与连续虚拟地址" loading="lazy" src="https://cybersecurityerial.github.io/echo_blog/images/llm-system-deepep-v2-elastic-communication/02-elastic-buffer-memory.png"&gt;&lt;/p&gt;
&lt;p&gt;CPU 与 GPU 内存物理上分段，但通过 CUDA VMM 映射为连续虚拟地址，再注册为 NCCL Window。这里的 Window 提供跨 Rank 访问语义；它本身不等同于 NVSHMEM 原生的对称内存抽象。&lt;/p&gt;
&lt;h2 id="barrier-与通信计算重叠"&gt;Barrier 与通信计算重叠&lt;/h2&gt;
&lt;p&gt;&lt;img alt="Barrier 跨 Stream 与跨 Rank 的两级同步" loading="lazy" src="https://cybersecurityerial.github.io/echo_blog/images/llm-system-deepep-v2-elastic-communication/03-barrier-overlap.png"&gt;&lt;/p&gt;
&lt;p&gt;图中展示的是全局 Barrier 的基本心智模型。Hybrid 分层 Barrier 的并行模式还存在一个容易误判的弱同步边界：A0 分别看到 B0 的 Scale-out 到达和 A1 的 Scale-up 到达，并不能推出 B1 已经到达。局部可见的两条同步事实不能自动合成为全局强 Barrier。&lt;/p&gt;
&lt;p&gt;&lt;code&gt;async_with_compute_stream&lt;/code&gt; 允许 Barrier 延迟返回 Event，在真正消费通信结果之前继续执行独立计算；&lt;code&gt;prefer_overlap_with_compute&lt;/code&gt; 则通过减少通信占用的 SM，为计算留下资源。&lt;/p&gt;</description></item></channel></rss>