新闻中心

新闻中心

XINWENZHONGXIN

你的位置:万博manbext网站登录 万博manbext体育官网注册账号入口 > 新闻中心 > 万博manbext网站登录app娱乐再看 EXO Labs 手里的两种开导-万博manbext网站登录 万博manbext体育官网注册账号入口

万博manbext网站登录app娱乐再看 EXO Labs 手里的两种开导-万博manbext网站登录 万博manbext体育官网注册账号入口

时间:2026-09-17 04:30 点击:157 次

万博manbext网站登录app娱乐再看 EXO Labs 手里的两种开导-万博manbext网站登录 万博manbext体育官网注册账号入口

英伟达桌面超算万博manbext网站登录app娱乐,邪修玩法来了!

两台 DGX Spark 串联一台苹果 Mac Studio,就能让大模子推理速率栽植至 2.77 倍。

这是 GitHub 三万星大模子框架作家 EXO Lab 团队发布的最新效用。

这个 EXO Labs,成心沟通把大模子放到各式家用开导上运行。

之前,还有,王人是这家责任室的手笔。

此次他们又把 DGX Spark 和 M3 Ultra 聚合,利用它们各自的上风,在大模子部署上整出了新活。

那么,这套邪修组合具体是怎么终了的呢?

PD 分离 + 流式传输,让开导各司其职

要想领略怎么聚合两种开导的上风,需要先了解大模子推理的责任阵势。

大模子的推理,主要分为 Prefill 和 Decode 两个阶段。

Prefill 处理领导并为每个 Transformer 层构建一个 KV 缓存,Decode 阶段则是凭据构建好的扫数这个词 KV 缓存生成 token。

两个阶段任务不同,对硬件性能的侧重也不相通,举座上来说 Prefill 更吃算力,而 Decode 吃内存带宽。

具体来说,Prefill 阶段计较量随领导长度呈二次增长,利用 Flash Attention 等时间,不错优化为线性增长,但计较量依然宽敞,因此主要受制于计较才智;

到了 Decode 阶段,KV 缓存一经计较罢了,不需要再重新运算,矩阵 - 矩阵乘法酿成了运算量更低的向量 - 矩阵乘法比,对算力的需求裁汰,主要受制于内存带宽。

再看 EXO Labs 手里的两种开导,DGX Spark 算力强可是带宽不成,Mac Studio 搭载的 M3 Ultra 则刚好相悖,内存带宽高但算力不如 DGX Spark。

具体来说,DGX Spark 有 100TFLOPS 的 fp16 算力,M3 Ultra 唯有 26TFLOPS;而 M3 Ultra 有 256GB@819GB/s 的内存,DGX Spark 却唯有 128GB@273GB/s。

是以,EXO Labs 的想路等于把 Prefill 和 Decode 阶段分开,隔离分派给擅长的开导,DGX Spark 证据 Prefill,Mac 则证据 Decode,这也等于 AI Infra 业界常说的 PD 分离。

最粗浅的 PD 阵势等于先把 Prefill 作念完,然后再传输给 Decode 开导进行 Decode。

但这就加多了两个阶段之间的通讯老本,要是传输期间过长,效果可能滥竽充数。

是以,进行 PD 分离运算需要搞定的要津问题是,等于 KV 缓存传输。

这里 EXO Labs 摆布了流式传输的想想。

咱们在网上看电影、刷 B 站时,并不需要把扫数这个词视频文献加载完才能运行播放,而是将一小段加载到内存之后就不错不雅看,后头的内容边看边加载,这等于流式传输。

音视频不错边传边看,KV 缓存也不错边算边传,因为大模子当中包含了多个 Transformer 层,使得 KV 缓存不一定非要以一个 Blob 的表情到达 Decode 开导,而是不错逐层到达。

第 1 层的 Prefill 完成后,其 KV 缓存就运行传输到给 M3 Ultra 去 Decode,同期第 2 层的 Prefill 则在 DGX Spark 上运行,每一层的通讯王人与后续层的计较重迭。

实践上, EXO 还会在处理层的进程中传输该层的 KV 向量,因为 KV 向量的计较是在最劳苦的计较方法之前进行的。

利用 EXO 框架,PD 分离、逐层 KV 流以及硬件感知王人不错自动完成。

启动 EXO 时,它会自动发现诱导的扫数开导,并针对计较费解量、内存带宽、内存容量和网罗特色对每个开导进行分析。

给定一个模子和拓扑结构, EXO 就会策动哪个开导应该处理 Prefill,哪个开导应该处理 Decode,是否需要跨层活水线,何时传输 KV 对,以及如安在网罗条目发生变化时进行转化。

最终,在 DGX Spark 和 Mac Studio 的组合下,Llama-3.1 8B 在 Prefill 阶段的速率栽植至了 Mac 的 3.79 倍,Decode 速率栽植至 DGX Spark 的 3.37 倍,举座栽植至 Mac Studio 的 2.77 倍。

Three More Things

EXO 这种 PD 分离的作念法,英伟达我方也在进行尝试,其行将推出的 Rubin CPX 平台将使用计较密集型 Rubin CPX 处理器进行 Prefill,配备巨大 HBM3e 内存带宽的秩序 Rubin 芯片则证据 Decode。

再说 EXO 团队此次用的 DGX Spark,最近正在进行配送,马斯克、奥特曼还有 LeCun 王人收到了,其中还有老黄躬行送货上门。

另外,AI 性能也有一定栽植。

在 M5 芯片的 MacBook Pro 上,首个 Token 生成速率(主要受 Prefill 影响)栽植到了 M1 的 6.4 倍、M4 的 3.55 倍。

另外,也有更快的图像 / 视频生成、更快的微调,以及更高的费解量。

不外宣传上说的是性能的又一次跃升,但仔细一看,M5 甚而不如 M4 Max,M4 Max 又甚而不如 M3 Ultra ……

而 EXO 的这波操作下,M3 Ultra 的含金量似乎更高了。

参考衔接:

[ 1 ] https://blog.exolabs.net/nvidia-dgx-spark/

[ 2 ] https://www.tomshardware.com/software/two-nvidia-dgx-spark-systems-combined-with-m3-ultra-mac-studio-to-create-blistering-llm-system-exo-labs-demonstrates-disaggregated-ai-inference-and-achieves-a-2-8-benchmark-boost

[ 3 ] https://x.com/awnihannun/status/1978465715121250801

一键三连「点赞」「转发」「严防心」

接待在评述区留住你的方针!

—  完  —

� �  年度科技风向标「2025 东谈主工智能年度榜单」评比报名开启啦!咱们正在寻找 AI+ 时间领航者  

❤️‍� �   企业、家具、东谈主物 3 大维度,共设立了 5 类奖项,接待企业报名参与   � �  

一键见谅 � � 点亮星标

科技前沿进展逐日见万博manbext网站登录app娱乐

官网: www.uniquant.top

邮箱: ba3503f4@outlook.com

地址: 新闻中心科技园7181号

Powered by 万博manbext网站登录 万博manbext体育官网注册账号入口 RSS地图 HTML地图


万博manbext网站登录 万博manbext体育官网注册账号入口-万博manbext网站登录app娱乐再看 EXO Labs 手里的两种开导-万博manbext网站登录 万博manbext体育官网注册账号入口