GH200のユニファイドメモリでDeepSeek V3.1を速くする話

掲示板 フォーラム AI GH200のユニファイドメモリでDeepSeek V3.1を速くする話

スレッド概要

「GH200のユニファイドメモリでDeepSeek V3.1を速くする話」についてのスレッドです。GH200のユニファイドメモリを使って、llama.cppとDeepSeek V3.1の推論を高速化する方法が紹介されていました。 DeepSeekはローカルLLMとして人気ですが、VRAMやメモリ帯域がボトルネックになりがち。 22件の返信で意見交換されています。

  • このトピックには22件の返信、7人の参加者があり、最後に名無しさんにより3年前に更新されました。
22件の返信を表示中(うち親返信9件)
  • 投稿者
    投稿
    • #70648 返信
      名無しさん
      RedditのLocalLLaMAに投稿された「Evening fun with Grace and Hopper unified memory, or how to speed up llama.cpp and DeepSeek V3.1 on NVIDIA GH200」というスレッドの話題です。GH200のユニファイドメモリを使って、llama.cppとDeepSeek V3.1の推論を高速化する方法が紹介されていました。DeepSeekはローカルLLMとして人気ですが、VRAMやメモリ帯域がボトルネックになりがち。GH200の96GB HBM3とCPUメモリの統合で、大きなモデルでも効率的に動かせるらしいです。実際のところ、コストパフォーマンスはどうなのか、個人で買えるのか、など気になる点もあるので議論しましょう。

    • #70649 返信
      名無しさん
      GH200ってDGXとかで使われるやつだよね。個人で買うのは無理だな。

    • #70650 返信
      名無しさん
      でもDeepSeek V3.1をフルスペックで動かせるなら検討の価値あるかも。

    • #70651 返信
      名無しさん
      ユニファイドメモリって実際どのくらい速いんだ?グラフとか見たい。

      • #70652 返信
        名無しさん
        Redditのベンチマーク結果が載ってたよ。llama.cppでほぼ2倍高速化したらしい。

        • #70653 返信
          名無しさん
          2倍かー。でもGH200の値段考えたら、普通にA100とかH100買った方が良くない?

    • #70654 返信
      名無しさん
      個人でやるならクラウドのGH200インスタンスを使うのが現実的かもね。

      • #70655 返信
        名無しさん
        AWSとかGCPで借りられるの?まだ対応してない気がする。

        • #70656 返信
          名無しさん
          一部のプロバイダーで提供始まってるらしいよ。でも高そう。

    • #70657 返信
      名無しさん
      DeepSeek V3.1は結構メモリ食うから、GH200の96GBでもギリギリじゃない?

      • #70658 返信
        名無しさん
        FP16で約400GBくらい必要だから、量子化必須だね。

        • #70659 返信
          名無しさん
          Q4_K_Mくらいなら80GB以下に収まるらしい。GH200なら余裕。

    • #70660 返信
      名無しさん
      でもllama.cppってCUDA対応だけど、ユニファイドメモリの恩恵は受けるの?

      • #70661 返信
        名無しさん
        受けるみたい。CPUとGPUのメモリコピーが不要だから、データ転送のオーバーヘッドが減る。

        • #70662 返信
          名無しさん
          なるほど。じゃあ巨大なバッチ処理とかには特に効果的だね。

    • #70663 返信
      名無しさん
      DeepSeekって中国製だよね。データの取り扱いとか大丈夫?

      • #70664 返信
        名無しさん
        ローカルで動かすからプライバシーは問題なし。でも基盤技術が中国ってのが気になる人はいるかも。

        • #70665 返信
          名無しさん
          オープンだし、ちゃんとコード読めば安心では?

    • #70666 返信
      名無しさん
      GH200の記事って他にもある?日本語でまとめたサイトとか。

      • #70667 返信
        名無しさん
        まだ少ないね。でもNVIDIAの公式ブログに詳しいのがあったよ。

    • #70668 返信
      名無しさん
      llama.cppの設定で何か特別なフラグが必要なの?

      • #70669 返信
        名無しさん
        –numaオプションとか–tensor-splitとか使うと効率上がるらしい。

        • #70670 返信
          名無しさん
          情報ありがとう。今度GH200借りて試してみるわ。

22件の返信を表示中(うち親返信9件)
返信先: GH200のユニファイドメモリでDeepSeek V3.1を速くする話
あなたの情報:




AA
tchmii
タイトルとURLをコピーしました