DeepSeek-R1-0528-Qwen3-8Bの最適設定について

掲示板 フォーラム AI DeepSeek-R1-0528-Qwen3-8Bの最適設定について

スレッド概要

「DeepSeek-R1-0528-Qwen3-8Bの最適設定について」についてのスレッドです。コード生成、コスト、プライバシー、ベンチマークなどの話題が出ていて、設定温度やtop_p、コンテキスト長、量子化などについて議論されています。 : このモデルを使っている人、どんな設定がベストだと思いますか? 26件の返信で意見交換されています。

  • このトピックには26件の返信、8人の参加者があり、最後に名無しさんにより2年、 10ヶ月前に更新されました。
26件の返信を表示中(うち親返信10件)
  • 投稿者
    投稿
    • #81218 返信
      名無しさん
      RedditのLocalLLaMA板で、DeepSeek-R1-0528-Qwen3-8Bの最適設定についてのスレッドがありました。コード生成、コスト、プライバシー、ベンチマークなどの話題が出ていて、設定温度やtop_p、コンテキスト長、量子化などについて議論されています。: このモデルを使っている人、どんな設定がベストだと思いますか?

    • #81219 返信
      名無しさん
      自分は温度0.6、top_p0.9で使ってる。コード生成は結構安定してる印象。

      • #81221 返信
        名無しさん
        温度0.6は高いほうじゃない?自分は0.3にしてる。

        • #81225 返信
          名無しさん
          温度0.3だと出力が硬すぎない?クリエイティブなタスクには0.7くらいがいいかも。

      • #81228 返信
        名無しさん
        コード生成なら温度低めの方がいいよね。自分は0.2。

    • #81220 返信
      名無しさん
      Qwen3-8BベースのR1ってことは、推論特化ってこと?

      • #81222 返信
        名無しさん
        そうみたい。DeepSeekのR1シリーズは推論用で、Qwenベースらしい。

    • #81223 返信
      名無しさん
      量子化はGGUFのQ4_K_Mが無難かな。

      • #81224 返信
        名無しさん
        Q4_K_Mで動かしてるけど、精度は十分。8Bだからメモリも食わないし。

    • #81226 返信
      名無しさん
      このモデル、DeepSeek-R1の改良版?それとも別物?

      • #81227 返信
        名無しさん
        0528って日付だから、その時点のスナップショットだと思う。Qwen3ベースでファインチューンされてる。

    • #81229 返信
      名無しさん
      ベンチマークではMATHとかGSM8Kで高いスコア出てるらしい。試してみたい。

      • #81230 返信
        名無しさん
        でも8Bじゃ限界あるよ。もっと大きなモデルに期待。

        • #81231 返信
          名無しさん
          ローカルで動かすには8Bくらいがちょうどいい。70Bは無理。

    • #81232 返信
      名無しさん
      コスパ重視ならこれで十分。API使うよりプライベートだし。

      • #81233 返信
        名無しさん
        確かに。でもDeepSeekのAPI自体が安いから、ローカルにこだわる必要ある?

        • #81234 返信
          名無しさん
          プライバシー面でローカルの価値はあるよ。データ送りたくないし。

    • #81235 返信
      名無しさん
      コンテキスト長はどれくらいまでいけるの?8K?

      • #81236 返信
        名無しさん
        多分デフォルト4Kだけど、拡張可能らしい。試してないけど。

      • #81237 返信
        名無しさん
        32Kとか無理でしょ。8Bに長文は荷が重い。

    • #81238 返信
      名無しさん
      このスレのReddit元記事、コメント少なかったけど参考になる。

      • #81239 返信
        名無しさん
        あの程度の情報ならここで十分。もっと詳しい人いるし。

    • #81240 返信
      名無しさん
      rep_penaltyとかも設定したほうがいいのかな?

      • #81241 返信
        名無しさん
        コード生成なら1.1くらいでいいと思う。チャットだと1.0。

        • #81242 返信
          名無しさん
          細かい設定よりモデル自体の品質のほうが大事。

    • #81243 返信
      名無しさん
      とりあえずllama.cppで動かしてるけど、問題なし。

      • #81244 返信
        名無しさん
        Ollamaでも動くよ。設定楽でいい。

26件の返信を表示中(うち親返信10件)
返信先: DeepSeek-R1-0528-Qwen3-8Bの最適設定についてで#81220に返信
あなたの情報:




AA
tchmii
タイトルとURLをコピーしました