dbow
V2EX  ›  Local LLM

两台 dgx-spark 部署满血 deepseek v4 flash 完全指南,稳定 60~70tok/s 单流

  •  1
     
  •   dbow · 17 days ago · 7502 views
    前天看 x 上有人做成这事, 觉得很不错, 下单买了两台, 6 万 8, nvidia 原厂 dgx spark 带并连线
    实测两台刚好能拿捏 deepseek v4 flash 0731 ,vibe coding 单流 60–70 tok/s 的体验足以覆盖日常 ;不是“能跑起来”的演示水平,而是可以当主力开发机稳定干活。
    主要是为了本地化隐私部署, 经常会跟 ai 聊很多机密信息, 不放心, 靠硬件出 token 得好几年才能回本.
    欢迎交流
    github: https://github.com/maliubiao/dgx-spark-2-deepseek-flash-0731
    Supplement 1  ·  7 days ago
    8-17 号记, v4 flash, v4 pro 涨价 3 倍以上之后, 一年就回本了
    Supplement 2  ·  3 days ago
    8-21 日记,京东双 dgx-spark 涨价至 7.2w, 涨价 5000 块。
    63 replies    2026-08-18 11:08:35 +08:00
    yoshiyuki
        1
    yoshiyuki  
       17 days ago
    但是你的 agent 说到底是联网的, 信息潜在的泄漏点太多了
    Lazymio
        2
    Lazymio  
       17 days ago
    6 万 8 是京东自营的?感觉买贵了。
    SayHelloHi
        3
    SayHelloHi  
       17 days ago
    @dbow

    老铁咨询下,DXG 使用 comfyui 体验如何?

    也想入手
    wyntalgeer
        4
    wyntalgeer  
       17 days ago
    感谢,已 star
    dbow
        5
    dbow  
    OP
       17 days ago
    @SayHelloHi 跑一个 deepseek v4 flash 90%计算资源就用光了, 暂时还没试过别的东西.
    Insolitude
        6
    Insolitude  
       17 days ago via Android
    可以帮忙用 llama-benchy ( https://github.com/eugr/llama-benchy )测一下吗?之前用两台 spark 测过预览版的 deepseekv4 flash ,当时跑起来还蛮吃力的,想看看现在性能怎么样


    """
    | model | test | t/s (total) | t/s (req) | peak t/s | peak t/s (req) | ttfr (ms) | est_ppt (ms) | e2e_ttft (ms) |
    |:------------------------------|------------:|----------------:|----------------:|-------------:|-----------------:|------------------:|------------------:|------------------:|
    | deepseek-ai/DeepSeek-V4-Flash | pp2048 (c1) | 955.27 ± 193.11 | 955.27 ± 193.11 | | | 2257.64 ± 530.54 | 2251.15 ± 530.54 | 2257.64 ± 530.54 |
    | deepseek-ai/DeepSeek-V4-Flash | tg32 (c1) | 38.67 ± 1.58 | 38.67 ± 1.58 | 39.93 ± 1.63 | 39.93 ± 1.63 | | | |
    | deepseek-ai/DeepSeek-V4-Flash | pp2048 (c2) | 919.38 ± 159.59 | 586.78 ± 244.14 | | | 3948.41 ± 1160.98 | 3941.91 ± 1160.98 | 3948.41 ± 1160.98 |
    | deepseek-ai/DeepSeek-V4-Flash | tg32 (c2) | 39.08 ± 20.50 | 25.04 ± 9.26 | 58.67 ± 3.09 | 29.79 ± 3.35 | | | |
    | deepseek-ai/DeepSeek-V4-Flash | pp2048 (c4) | 924.07 ± 122.40 | 358.73 ± 142.02 | | | 6692.54 ± 2550.41 | 6686.05 ± 2550.41 | 6692.54 ± 2550.41 |
    | deepseek-ai/DeepSeek-V4-Flash | tg32 (c4) | 18.68 ± 2.40 | 10.41 ± 5.84 | 71.33 ± 4.03 | 19.42 ± 1.32 | | | |

    llama-benchy (0.3.7)
    date: 2026-05-18 16:43:49 | latency mode: api
    """
    mouyase
        7
    mouyase  
       17 days ago
    《不是“能跑起来”的演示水平,而是可以当主力开发机稳定干活。》

    您也 AI 化了。
    dbow
        8
    dbow  
    OP
       17 days ago
    @mouyase ai 写的文档, 我复制了一句过来, 哈哈
    Nasdaq
        9
    Nasdaq  
       17 days ago
    请教老哥,功耗/发热怎么样?我也想搞 2 台玩玩。
    defunct9
        10
    defunct9  
       17 days ago
    新模型发布这么快,花 6 万 8 ,合适么?
    Tink
        11
    Tink  
       17 days ago
    好像还不错啊
    ferch
        12
    ferch  
       17 days ago
    这很好呀,能自己本地玩了
    dbow
        13
    dbow  
    OP
       17 days ago   ❤️ 1
    @Nasdaq agent 跑起来 gpu 70 度左右
    asdjgfr
        14
    asdjgfr  
       17 days ago
    省着点用,10 年之后我要捡垃圾自己部署一个😆
    Nasdaq
        15
    Nasdaq  
       17 days ago
    @dbow #12 继续请教您,部署起来困难吗?还是说能让 cc/cx 直接托管一键部署?
    lizhenda
        16
    lizhenda  
       17 days ago
    等新模型发布了,硬件不够用了怎么办?
    ysz1121
        17
    ysz1121  
       17 days ago
    6.8w 充 deepseek 官方,是不是能用一年?
    shyrock2026
        18
    shyrock2026  
       17 days ago
    op 这个速度是开的 200k 上下文还是 1m 呢?
    dbow
        19
    dbow  
    OP
       17 days ago   ❤️ 1
    @Nasdaq 全交给 ai
    dbow
        20
    dbow  
    OP
       17 days ago   ❤️ 1
    Newb1e
        21
    Newb1e  
       17 days ago
    心动
    faker5276
        22
    faker5276  
       17 days ago
    deepseek 涨价以后,这方案就有性价比了
    op351
        23
    op351  
       17 days ago
    @ysz1121 按现在 ds 的 api 定价,一天 24 小时不停的用,保守点能用 10 年
    不过现阶段算力本地部署基本不是为了省钱,而是为了合规和数据隐私
    dbow
        24
    dbow  
    OP
       17 days ago   ❤️ 1
    @op351 大概三年能回本, 目前一个月 1k 的 v4 flash api 费用,假定涨价后价格翻倍, 则一年需要 2.4w 的 token 费用, 算上电费之后三年回本.
    yanhuqing666
        25
    yanhuqing666  
       17 days ago
    有点意思
    AEDaydreamer
        26
    AEDaydreamer  
       17 days ago
    没钱没需求, 但是看完有很心动的感觉.
    lhtdeg
        27
    lhtdeg  
       17 days ago
    速度这么快?那我也要搞一个了
    Lighfer
        28
    Lighfer  
       17 days ago via Android
    老哥,有试过能支撑多少并发和速度不?
    Lighfer
        29
    Lighfer  
       17 days ago via Android
    @Lighfer 看到了链接里有
    ziyeziye
        30
    ziyeziye  
       17 days ago
    看看 B 站有搭配教程
    [全网首发] 11999-31999 元,22t/s 本地部署 deepseek-v4 v4pro ,支持 agent 、codex ,本地知识库,无需使用 Linux
    [全网首发] 11999-31999 元,22t/s 本地部署 deepseek-v4 v4pro ,支持 agent 、codex ,本地知识库,无需使用 Linux
    [全网首发] 4799 部署 wukomg4.1 ,本地 agent 万能小模型,单机 8 并发支持 claw 与知识库,无需使用 Linux !
    [全网首发] 4799 部署 wukomg4.1 ,本地 agent 万能小模型,单机 8 并发支持 claw 与知识库,无需使用 Linux !
    [全网首发] 11999 元,11t/s 本地部署 glm5.2 ,支持 claw 与 agent 知识库,win11 操作无需使用 Linux !
    [全网首发] 11999 元,11t/s 本地部署 glm5.2 ,支持 claw 与 agent 知识库,win11 操作无需使用 Linux !
    [全网首发] 2899 元 30t/s ,4.8 升体积 qwen3.6-27b 本地部署,Windows 下支持 agent ,龙虾,5999 元可跑原版非量化,无需 linux 操作
    [全网首发] 2899 元 30t/s ,4.8 升体积 qwen3.6-27b 本地部署,Windows
    Nasdaq
        31
    Nasdaq  
       17 days ago
    @ziyeziye 我是 4090 ,部署过 qwen3.6-27B ,速度可以。但是蠢哭了~
    ziyeziye
        32
    ziyeziye  
       17 days ago
    @ziyeziye 都是满血版的
    seers
        33
    seers  
       16 days ago via iPhone
    模型也在进化,相同硬件也可以免费获取性能升级
    wsbqdyhm
        34
    wsbqdyhm  
       16 days ago
    @Nasdaq #31 20-30 的速度,经常任务中断
    Nasdaq
        35
    Nasdaq  
       16 days ago
    @wsbqdyhm 那还没有深入测,跑了个 30 分钟感觉不行就丢了。
    Yserver
        36
    Yserver  
       16 days ago
    感觉有点慢 ds 新的那个加速是不是没生效啊?
    dbow
        37
    dbow  
    OP
       16 days ago
    @Yserver 已经开启了 dspark 才有 60~70tok/s
    sillydaddy
        38
    sillydaddy  
       16 days ago
    这么估算回本时间呢:
    1. Deepseek ,1 次调用平均输出 420 token ,按官方 API 计价花费¥0.004 元。那么¥68000 元可以纯输出 7,140,000,000 个 token 。

    2. 现在驱使 DGX-Spark ,每秒输出 60 token 。

    回本需要 3.7 年=7,140,000,000÷60÷3,600÷24÷365 。(电费是零头)
    dbow
        39
    dbow  
    OP
       16 days ago
    @sillydaddy 这只算了输出, 实际并发能做到 200tok/s, 输入能做到 1000 tok/s,输入也是收费的
    fanhed
        40
    fanhed  
       16 days ago
    @yoshiyuki agent 是否联网是可控的
    fanhed
        41
    fanhed  
       16 days ago
    @sillydaddy 还要算 prefill, 还要算 prefill 的 cache 命中
    bigdogbigpig
        42
    bigdogbigpig  
       16 days ago
    如果满血 ds v4 flash 可以用两台 dgx spark 部署,那还有别的模型可以部署吗?
    yoshiyuki
        43
    yoshiyuki  
       16 days ago
    @fanhed 现实中真正投入使用的 agent, 联网的多, 不联网的少
    yinmin
        44
    yinmin  
       15 days ago via iPhone
    @dbow 有没有测试过 input 在 10 万 token 时,几秒后开始吐字,速度能到多少 token/s ? 如果做 coding ,input token 在 10 万-30 万还是很常见的,不知道性能如何
    dbow
        45
    dbow  
    OP
       15 days ago
    @yinmin 有 kv cache, 非常快, 速度稳定不变, codex 上跑一个晚上的任务也不会崩.
    Jacobson
        46
    Jacobson  
       15 days ago via iPhone
    @AEDaydreamer 你不孤单☹️
    Suroy
        47
    Suroy  
       15 days ago
    666 ,OP 有没有测过 1 台能玩的最好模型,手里只有一台
    dbow
        48
    dbow  
    OP
       15 days ago
    @Suroy 1 只能跑量化损失较大的模型
    bunai
        49
    bunai  
       14 days ago
    @Suroy 一台就是玩具
    Suroy
        50
    Suroy  
       13 days ago
    那当玩具玩算咯 哈哈哈,只能跑 27b 量化小模型
    ChinaCN
        51
    ChinaCN  
       13 days ago
    up 跑什么任务需要长时间烧 token 呐
    siriulx
        52
    siriulx  
       12 days ago
    最近也在考虑买 dgx spark ,多谢 op 分享
    v2exgo
        53
    v2exgo  
       12 days ago
    @Suroy #50 本地最好的用途就是 解锁逆向分析,这块 AI 最有价值的
    v2exgo
        54
    v2exgo  
       12 days ago
    目前有跑解锁版的 v4 flash 么?逆向分析能力怎么样?
    dbow
        55
    dbow  
    OP
       12 days ago
    @v2exgo v4 flash 对逆向来者不拒, 不用解锁
    v2exgo
        56
    v2exgo  
       12 days ago
    @dbow #55 那就完美了,吊的一笔
    v2exgo
        57
    v2exgo  
       12 days ago
    @v2exgo #54 写注册机 这些 都可以么?
    v2exgo
        58
    v2exgo  
       12 days ago
    @dbow #55 /Users/winters/.cache/clipaste/shot-mspkslp4.png

    不行啊,铁铁
    dbow
        59
    dbow  
    OP
       12 days ago
    @v2exgo trace 完给它数据, 不要有品牌这些东西, 让它还原算法.
    qazwsxkevin
        60
    qazwsxkevin  
       12 days ago
    @dbow #59 请教:gpt 5.6 设计和校验了 C++的前后端的系统设计书(逻辑非常细节),DGX Spark 双机,跑 DeepSeek V4 falsh ,吩咐 DGX 双机,能完成这个整套的作业量吗? (双 DGX 跑了 v4 flash 后,还能有多少上下文空间?)
    dbow
        61
    dbow  
    OP
       11 days ago
    @qazwsxkevin 不是机密没必要用 dgx 双机, 它也正常支持 1M 上下文,跟 api 一样.
    qazwsxkevin
        62
    qazwsxkevin  
       11 days ago
    @dbow #61 谢谢! 只是想了解 ds v4 flash 在双 DGX 下,KV 怎么样而已。

    by the way ,我这里情况特殊,自有环境,过往 API 的使用遭遇,还是要有不过审特性的 LLM(其它的),比如在做设计书时(gpt 5.5 时期)就遇上了不少 cyber 反应,。设计书定版后,估计 API 做起来有道德桩阻碍,不过这些破事情最后都是在企业大内网的测试(的支线任务)用的,环境和辐射范围可控。
    abcfyk
        63
    abcfyk  
       6 days ago
    https://github.com/maliubiao/dgx-spark-2-deepseek-flash-0731 这玩意儿是 FP4 量化版本的,你确定在生产环境用不会被叼飞吗
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   5064 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: edcf295e · 69ms · UTC 09:47 · PVG 17:47 · LAX 02:47 · JFK 05:47
    ♥ Do have faith in what you're doing.