スレッド概要
「Kimi K2 Thinkingの量子化: 2.5~3.5bpwで実用的?」についてのスレッドです。DeepSeek系はネイティブ8ビットで3bpw以上なら実用的という意見がある中、K2 Thinkingではどうかという議論です。 23件の返信で意見交換されています。
- このトピックには23件の返信、7人の参加者があり、最後に名無しさんにより2年、 11ヶ月前に更新されました。
23件の返信を表示中(うち親返信11件)
-
投稿者投稿
-
-
名無しさんRedditのr/LocalLLaMAで、Kimi K2 Thinking(ネイティブ4ビット)を2.5~3.5bpwに量子化した場合の性能について質問がありました。DeepSeek系はネイティブ8ビットで3bpw以上なら実用的という意見がある中、K2 Thinkingではどうかという議論です。
-
名無しさんネイティブ4ビットをさらに量子化すると、かなり劣化しそうな気がする。
-
名無しさんでもK2 Thinkingは思考モデルだから、量子化で思考能力が落ちるリスクもあるよ。
-
-
名無しさんDeepSeekの例があるから、3bpwくらいなら案外使えるかも。
-
名無しさん実際に試した人いる?自分は32GBのVRAMで70Bモデル動かすのに苦労してる。
-
名無しさんK2 Thinkingはパラメータ数いくつだっけ?公式情報少ないよね。
-
-
名無しさんネイティブ4ビットってことは、もともと量子化済みってこと?それならこれ以上減らすのは厳しいか。
-
名無しさんいや、ネイティブ4ビットって学習時のビット幅の話で、推論時はさらに落とせる場合もある。
-
名無しさんなるほど。でも品質は確実に下がるから、用途次第だね。
-
-
-
名無しさんDeepSeek R1とかも3bpwで結構使えるって評判だけど、K2はどうだろ。
-
名無しさんR1はネイティブ8ビットだから、K2よりマージンがある。
-
-
名無しさん個人的には、2.5bpwはさすがに無理だと思う。3.5bpwなら試す価値あり。
-
名無しさんそうそう、自分も3.0bpw以上なら使える説に賛成。
-
-
名無しさんK2 Thinkingってコーディング向けって噂だけど、量子化でバグが増えたりしない?
-
名無しさんあくまで確率的なものだから、量子化で精度落ちるとコード生成も怪しくなる。
-
-
名無しさんVRAM節約のために量子化するのは分かるけど、品質とのトレードオフがね。
-
名無しさん例えば24GB VRAMで動かしたいなら、3bpwくらいが現実的じゃない?
-
名無しさんK2 Thinkingのサイズ次第だけど、70Bクラスなら3bpwでも24GBは厳しいかも。
-
-
-
名無しさんRedditのスレでもあんまり情報なくて、実際に試した人の声が聞きたい。
-
名無しさん海外のフォーラムでもまだ初期段階だし、これからベンチマーク出てくるんじゃない?
-
-
名無しさん自分はDeepSeek Coderで満足してるから、あえてK2に手を出す必要ないかも。
-
名無しさんでもK2は思考連鎖が強いって聞くから、量子化でどこまで保てるかだな。
-
-
名無しさん結論が出るまでは、とりあえずフル精度で試すのが無難。
-
名無しさんそうだね。でも量子化技術も進んでるから、思ったより使えるかも。
-
-
-
投稿者投稿
23件の返信を表示中(うち親返信11件)
関連するAIトピック
- DeepSeek V3でコード監査エージェント作ったってのスレ。AST解析+ハイブリッド検索でシニア級らしい。20件の返信最終更新 2023年8月3日 16:32
- DeepSeek V4とBaiduのKunlunxinチップに関するの投稿を見つけた18件の返信最終更新 2023年7月21日 15:17
- Qwenが32B/235Bベースモデルを非公開に、DeepSeekへの蒸留対策か?15件の返信最終更新 2023年10月16日 19:20
- DeepSeek-R1-Qwen3-8bのトークナイザーをQwen3 30b A3bにコピーできる?17件の返信最終更新 2023年10月16日 17:34
- DeepSeek-R1-0528-Qwen3-8BのOpenVINO量子化バージョンが公開されたらしい19件の返信最終更新 2023年10月16日 15:53