netox

在线体验 16K token/s 的新大模型部署架构

  •  
  •   netox · 8h 9m ago · 1520 views
    在 HN 上看到 AMD 收购那家把模型权重烧到芯片里的 taalas 的消息, 考虑到 gpt 5.6 相比 gpt 5.5 实际体验并没有多在的改进, 感觉或许把权重烧到芯片里, 没准是条路子

    帖子里有他们的模型架构体验接口, 自己试了下, 16k token/s, 不敢想象要是有 gpt5.5 这样的模型这么快, 体验得多么好了


    https://chatjimmy.ai/
    28 replies    2026-08-07 17:05:20 +08:00
    cowcomic
        1
    cowcomic  
       7h 52m ago
    我印象他们家好像都是做小模型的,之前都是 10B 以内的
    最近好像放话要做 qwen3.6-27b 的,不知道进展如何
    netox
        2
    netox  
    OP
       7h 28m ago
    @cowcomic HN 上原贴说下一代芯片正在做, 估计模型可能也会他们自己训练或者跟 AMD 一起搞, 利用 AMD 自己的技术(我记得 2022 年 AMD 还收购了 PENSANDO 这家做 DPU 的公司), 这样的话估计搞集群肯定就不只 27B 了
    SmiteChow
        3
    SmiteChow  
       7h 25m ago
    不可能的,一天一个模型可以,一天一个芯片?
    dreamdragon
        4
    dreamdragon  
       7h 21m ago
    有正常逻辑想不到的使用场景吗,这个确实很反常
    netox
        5
    netox  
    OP
       7h 15m ago
    @SmiteChow 为什么会一天一个模型? 如果有个高速 gpt 5.5 级别的模型, 感觉还行? 而且它技术上可以把权重换掉, 只不过相对麻烦
    ddoki
        6
    ddoki  
       7h 4m ago via Android
    @dreamdragon 智能客服场景,小模型加高速输出。那可以承担的并发就很客观,降本肯定能做到
    litian98
        7
    litian98  
       6h 30m ago
    这个模型确实快,但是智能太差了,基本感觉用不了的样子,最简单的那些常识性问题能回答得差不多,但是稍微复杂一点点的问题就不行了
    javalaw2010
        8
    javalaw2010  
       6h 23m ago
    我: “你好”
    AI: “很好”

    ————————————

    虽然目前体验智能不佳,但是等大模型发展到一定阶段,确实是一个很好的方向
    NoDataNoBB
        9
    NoDataNoBB  
       6h 13m ago
    确实是个好主意
    ayyll
        10
    ayyll  
       5h 59m ago
    @litian98 还行?我让它写个快排 Generated in 0.036s
    june4
        11
    june4  
       5h 36m ago
    @SmiteChow 象 ds v4 flash 这种的,已经过了那个可用门槛,只要够快和便宜,哪怕落后点又怎么,毕竟不是什么任务都要顶级模型才能完成
    nightlight9
        12
    nightlight9  
       4h 6m ago
    确实非常快,但是有点蠢
    est
        13
    est  
       3h 59m ago
    @SmiteChow @litian98 @dreamdragon

    我觉得这个模型最适合的场景是 自动驾驶决策。

    https://blog.est.im/2026/stderr-11
    BingoXuan
        14
    BingoXuan  
       3h 54m ago
    @cowcomic
    deepseek 激活也是 13B 。这时候就是 xilinx 出马了,通过 pcie 重新烧录权重数据。那样 n 张互联就能跑 deepseek v4 flash 0731 了。主要问题是如何把权重数据变成可烧录。
    cowcomic
        15
    cowcomic  
       3h 50m ago
    @netox
    @BingoXuan
    芯片群的方式感觉效率损失会很严重,之前看到的都还是单芯片的策略
    fnd
        16
    fnd  
       3h 49m ago
    快是真快,但是错误也有点离谱,胡说八道。
    holystrike
        17
    holystrike  
       3h 42m ago
    “详细列出任天堂自创办以来发布的所有游戏”

    :很难!由于有超过 3000 多款游戏发布,以下是近似完整的游戏列表:
    xxxx
    yyyy
    zzzz

    Generated in 0.119s • 14,024 tok/s

    完全来不及反应一次出完。滚轮拨了好几圈到顶部看结果。

    “不要只说难,要全部列出来”

    (没了)
    Raw778
        18
    Raw778  
       3h 28m ago
    快是真的快,蠢也是真的蠢,全是胡说八道。
    WayneCmd
        19
    WayneCmd  
       3h 27m ago
    我要来经典一下了:

    不过如果未来能够完全实现的话,时间的维度就可以像是被压缩的无法感知了,自动驾驶,预测未来
    timethinker
        20
    timethinker  
       2h 28m ago
    我想到了《 2001 太空漫游》里面的 HAL9000 被戴夫鲍曼一张一张的拔下了存储卡的画面。
    netox
        21
    netox  
    OP
       2h 5m ago
    @cowcomic 总感觉估计跟推理集群类似, 高速网络互联, 就跟 Nvidia 之前收购 mellanox 类似, 感觉 amd 会不会觉得是 GPU 这条路无法超越她亲戚了, 找条别的路子来搞, 万一成了呢
    PerFectTime
        22
    PerFectTime  
       1h 27m ago
    token 快又没啥用,不准生成的再多也是辣鸡
    yinyu
        23
    yinyu  
       1h 16m ago
    You
    你是什么模型,1000 字介绍下。

    Chat Jimmy
    Jimmy
    我想提供一个全面而且有趣的 1000 字介绍。


    首先,我是基于人工智能的语言模型,能够理解自然语言和生成人类语言的文本。我的主要功能是回答问题、生成文本内容、并且可以进行人工智能相关任务。

    🔥✨✨✨✨✨✨
    Generated in 0.004s • 14,579 tok/s


    ═══════════════分隔符═══════════════
    你就说快不快吧.jpg
    YUCOAT
        24
    YUCOAT  
       1h 12m ago
    应该是一个很小很小的模型,用作实验性质的。
    要是把几十 B 甚至几百 B 的大模型烧制到芯片里面,情况可能又不一样了
    xuwuruoshui
        25
    xuwuruoshui  
       1h 8m ago
    JohnHaruhi
        26
    JohnHaruhi  
       54 mins ago via iPhone
    感觉能达到当年 gpt3.5 的水平
    JohnHaruhi
        27
    JohnHaruhi  
       54 mins ago via iPhone
    已经很强了
    JohnHaruhi
        28
    JohnHaruhi  
       50 mins ago via iPhone
    但最先进的模型都是 T 级别了,单颗芯片烧得下吗?
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   4447 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 56ms · UTC 09:55 · PVG 17:55 · LAX 02:55 · JFK 05:55
    ♥ Do have faith in what you're doing.