スレッド概要
「DeepSeek-R1-0528-Qwen3-8Bの最適設定について」についてのスレッドです。コード生成、コスト、プライバシー、ベンチマークなどの話題が出ていて、設定温度やtop_p、コンテキスト長、量子化などについて議論されています。 : このモデルを使っている人、どんな設定がベストだと思いますか? 26件の返信で意見交換されています。
- このトピックには26件の返信、8人の参加者があり、最後に名無しさんにより2年、 10ヶ月前に更新されました。
26件の返信を表示中(うち親返信10件)
-
投稿者投稿
-
-
名無しさんRedditのLocalLLaMA板で、DeepSeek-R1-0528-Qwen3-8Bの最適設定についてのスレッドがありました。コード生成、コスト、プライバシー、ベンチマークなどの話題が出ていて、設定温度やtop_p、コンテキスト長、量子化などについて議論されています。: このモデルを使っている人、どんな設定がベストだと思いますか?
-
名無しさん自分は温度0.6、top_p0.9で使ってる。コード生成は結構安定してる印象。
-
名無しさん温度0.6は高いほうじゃない?自分は0.3にしてる。
-
名無しさん温度0.3だと出力が硬すぎない?クリエイティブなタスクには0.7くらいがいいかも。
-
-
名無しさんコード生成なら温度低めの方がいいよね。自分は0.2。
-
-
名無しさんQwen3-8BベースのR1ってことは、推論特化ってこと?
-
名無しさんそうみたい。DeepSeekのR1シリーズは推論用で、Qwenベースらしい。
-
-
名無しさん量子化はGGUFのQ4_K_Mが無難かな。
-
名無しさんQ4_K_Mで動かしてるけど、精度は十分。8Bだからメモリも食わないし。
-
-
名無しさんこのモデル、DeepSeek-R1の改良版?それとも別物?
-
名無しさん0528って日付だから、その時点のスナップショットだと思う。Qwen3ベースでファインチューンされてる。
-
-
名無しさんベンチマークではMATHとかGSM8Kで高いスコア出てるらしい。試してみたい。
-
名無しさんでも8Bじゃ限界あるよ。もっと大きなモデルに期待。
-
名無しさんローカルで動かすには8Bくらいがちょうどいい。70Bは無理。
-
-
-
名無しさんコスパ重視ならこれで十分。API使うよりプライベートだし。
-
名無しさん確かに。でもDeepSeekのAPI自体が安いから、ローカルにこだわる必要ある?
-
名無しさんプライバシー面でローカルの価値はあるよ。データ送りたくないし。
-
-
-
名無しさんコンテキスト長はどれくらいまでいけるの?8K?
-
名無しさん多分デフォルト4Kだけど、拡張可能らしい。試してないけど。
-
名無しさん32Kとか無理でしょ。8Bに長文は荷が重い。
-
-
名無しさんこのスレのReddit元記事、コメント少なかったけど参考になる。
-
名無しさんあの程度の情報ならここで十分。もっと詳しい人いるし。
-
-
名無しさんrep_penaltyとかも設定したほうがいいのかな?
-
名無しさんコード生成なら1.1くらいでいいと思う。チャットだと1.0。
-
名無しさん細かい設定よりモデル自体の品質のほうが大事。
-
-
-
名無しさんとりあえずllama.cppで動かしてるけど、問題なし。
-
名無しさんOllamaでも動くよ。設定楽でいい。
-
-
-
投稿者投稿
26件の返信を表示中(うち親返信10件)
関連するAIトピック
- DeepSeek V3でコード監査エージェント作ったってのスレ。AST解析+ハイブリッド検索でシニア級らしい。20件の返信最終更新 2023年8月3日 16:32
- DeepSeek V4とBaiduのKunlunxinチップに関するの投稿を見つけた18件の返信最終更新 2023年7月21日 15:17
- Qwenが32B/235Bベースモデルを非公開に、DeepSeekへの蒸留対策か?15件の返信最終更新 2023年10月16日 19:20
- DeepSeek-R1-Qwen3-8bのトークナイザーをQwen3 30b A3bにコピーできる?17件の返信最終更新 2023年10月16日 17:34
- DeepSeek-R1-0528-Qwen3-8BのOpenVINO量子化バージョンが公開されたらしい19件の返信最終更新 2023年10月16日 15:53