スレッド概要
「GH200のユニファイドメモリでDeepSeek V3.1を速くする話」についてのスレッドです。GH200のユニファイドメモリを使って、llama.cppとDeepSeek V3.1の推論を高速化する方法が紹介されていました。 DeepSeekはローカルLLMとして人気ですが、VRAMやメモリ帯域がボトルネックになりがち。 22件の返信で意見交換されています。
- このトピックには22件の返信、7人の参加者があり、最後に名無しさんにより3年前に更新されました。
22件の返信を表示中(うち親返信9件)
-
投稿者投稿
-
-
名無しさんRedditのLocalLLaMAに投稿された「Evening fun with Grace and Hopper unified memory, or how to speed up llama.cpp and DeepSeek V3.1 on NVIDIA GH200」というスレッドの話題です。GH200のユニファイドメモリを使って、llama.cppとDeepSeek V3.1の推論を高速化する方法が紹介されていました。DeepSeekはローカルLLMとして人気ですが、VRAMやメモリ帯域がボトルネックになりがち。GH200の96GB HBM3とCPUメモリの統合で、大きなモデルでも効率的に動かせるらしいです。実際のところ、コストパフォーマンスはどうなのか、個人で買えるのか、など気になる点もあるので議論しましょう。
-
名無しさんGH200ってDGXとかで使われるやつだよね。個人で買うのは無理だな。
-
名無しさんでもDeepSeek V3.1をフルスペックで動かせるなら検討の価値あるかも。
-
名無しさんユニファイドメモリって実際どのくらい速いんだ?グラフとか見たい。
-
名無しさんRedditのベンチマーク結果が載ってたよ。llama.cppでほぼ2倍高速化したらしい。
-
名無しさん2倍かー。でもGH200の値段考えたら、普通にA100とかH100買った方が良くない?
-
-
-
名無しさん個人でやるならクラウドのGH200インスタンスを使うのが現実的かもね。
-
名無しさんAWSとかGCPで借りられるの?まだ対応してない気がする。
-
名無しさん一部のプロバイダーで提供始まってるらしいよ。でも高そう。
-
-
-
名無しさんDeepSeek V3.1は結構メモリ食うから、GH200の96GBでもギリギリじゃない?
-
名無しさんFP16で約400GBくらい必要だから、量子化必須だね。
-
名無しさんQ4_K_Mくらいなら80GB以下に収まるらしい。GH200なら余裕。
-
-
-
名無しさんでもllama.cppってCUDA対応だけど、ユニファイドメモリの恩恵は受けるの?
-
名無しさん受けるみたい。CPUとGPUのメモリコピーが不要だから、データ転送のオーバーヘッドが減る。
-
名無しさんなるほど。じゃあ巨大なバッチ処理とかには特に効果的だね。
-
-
-
名無しさんDeepSeekって中国製だよね。データの取り扱いとか大丈夫?
-
名無しさんローカルで動かすからプライバシーは問題なし。でも基盤技術が中国ってのが気になる人はいるかも。
-
名無しさんオープンだし、ちゃんとコード読めば安心では?
-
-
-
名無しさんGH200の記事って他にもある?日本語でまとめたサイトとか。
-
名無しさんまだ少ないね。でもNVIDIAの公式ブログに詳しいのがあったよ。
-
-
名無しさんllama.cppの設定で何か特別なフラグが必要なの?
-
名無しさん–numaオプションとか–tensor-splitとか使うと効率上がるらしい。
-
名無しさん情報ありがとう。今度GH200借りて試してみるわ。
-
-
-
-
投稿者投稿
22件の返信を表示中(うち親返信9件)
関連するAIトピック
- DeepSeek V3でコード監査エージェント作ったってのスレ。AST解析+ハイブリッド検索でシニア級らしい。20件の返信最終更新 2023年8月3日 16:32
- DeepSeek V4とBaiduのKunlunxinチップに関するの投稿を見つけた18件の返信最終更新 2023年7月21日 15:17
- Qwenが32B/235Bベースモデルを非公開に、DeepSeekへの蒸留対策か?15件の返信最終更新 2023年10月16日 19:20
- DeepSeek-R1-Qwen3-8bのトークナイザーをQwen3 30b A3bにコピーできる?17件の返信最終更新 2023年10月16日 17:34
- DeepSeek-R1-0528-Qwen3-8BのOpenVINO量子化バージョンが公開されたらしい19件の返信最終更新 2023年10月16日 15:53