スレッド概要
「DeepSeek R1をTesla P40で6.5tk/s――ローカルLLMの実用性を語る」についてのスレッドです。 25件の返信で意見交換されています。
- このトピックには25件の返信、8人の参加者があり、最後に名無しさんにより2年、 10ヶ月前に更新されました。
25件の返信を表示中(うち親返信12件)
-
投稿者投稿
-
-
名無しさんRedditのLocalLLaMA板で、DeepSeek R1をNvidia Tesla P40(中古で安い12GB VRAMの古いGPU)で動かしたら6.5トークン/秒だったという投稿が話題になっていました。
-
名無しさんすごい!P40でもそこそこ動くんだな。意外と使えるかも。
-
名無しさんでも6.5tk/sだと実用にはキツくない?会話は辛いよね。
-
名無しさんバッチ処理なら十分だよ。やコード生成なら待てるレベル。
-
名無しさんコード生成なら待てる速度かも。ただし長い出力は注意。
-
-
名無しさん電気代考えたらクラウドの方が安くない?
-
名無しさんプライバシー重視なら自前運用もありだよ。企業は特に。
-
-
名無しさん量子化モデルならもっと速くなるはず。4bitにすればVRAMも節約。
-
名無しさんR1じゃなくてV3の方が効率いいって話も聞くが、どうなんだろう。
-
名無しさん実際に試したけど、メモリ足りなくて落ちた。バッチサイズ調整必須。
-
名無しさんバッチサイズ1にして、コンテキスト長を減らせば動くよ。
-
-
-
名無しさん価格差考えたらP40って今でも買いなのか?中古で数千円とか。
-
名無しさん中古で安いしいい選択肢だと思う。ただし消費電力がネック。
-
名無しさんサポート切れてるから将来性は微妙。新しいCUDA使えないし。
-
-
-
名無しさんDeepSeekの中国製ってのが気になる。検閲やデータ漏洩が怖い。
-
名無しさんそこは気分的な問題もあるよね。LLaMA系の方が安心かも。
-
名無しさん性能だけ見ればLLaMAの方が上って話も。ただしR1は軽量。
-
-
-
名無しさんこのスレのreddit元のコメントも参考になる。英語でも議論が深い。
-
名無しさん6.5tk/sってJP版だとどのくらい?日本語対応モデルなら遅くなる?
-
名無しさん日本語トークンは多いから、体感もう少し遅いかも。試した人いる?
-
-
名無しさん今のところ手軽さならllama.cppが最強。CUDAじゃなくても動くし。
-
名無しさんP40はVRAM多いから大きなモデル扱える利点はある。12GBはでかい。
-
名無しさんでも電力消費量はかなりだろうな。アイドルでも100W超えるし。
-
-
-
名無しさん自作PCに突っ込んで遊ぶにはいいかも。研究目的ならアリ。
-
名無しさん結局、用途次第ってことか。実験ならコスパ良い。
-
-
名無しさんもっと安い解決策ないかな?M4 Macとかの方が現実的?
-
-
投稿者投稿
25件の返信を表示中(うち親返信12件)
関連するAIトピック
- DeepSeek V3でコード監査エージェント作ったってのスレ。AST解析+ハイブリッド検索でシニア級らしい。20件の返信最終更新 2023年8月3日 16:32
- DeepSeek V4とBaiduのKunlunxinチップに関するの投稿を見つけた18件の返信最終更新 2023年7月21日 15:17
- Qwenが32B/235Bベースモデルを非公開に、DeepSeekへの蒸留対策か?15件の返信最終更新 2023年10月16日 19:20
- DeepSeek-R1-Qwen3-8bのトークナイザーをQwen3 30b A3bにコピーできる?17件の返信最終更新 2023年10月16日 17:34
- DeepSeek-R1-0528-Qwen3-8BのOpenVINO量子化バージョンが公開されたらしい19件の返信最終更新 2023年10月16日 15:53