DeepSeek-R1-0528の推論速度改善について語ろう

掲示板 フォーラム AI DeepSeek-R1-0528の推論速度改善について語ろう

スレッド概要

「DeepSeek-R1-0528の推論速度改善について語ろう」についてのスレッドです。DeepSeek-R1-0528の推論速度をどう改善するか、量子化やモデル並列化、キャッシュの工夫などが話題になっています。 ローカルLLMの活用やコスト削減、プライバシーの観点からも興味深いです。 13件の返信で意見交換されています。

  • このトピックには13件の返信、4人の参加者があり、最後に名無しさんにより2年、 10ヶ月前に更新されました。
13件の返信を表示中(うち親返信6件)
  • 投稿者
    投稿
    • #81409 返信
      名無しさん
      Redditのr/LocalLLaMAで「Improving DeepSeek-R1-0528 Inference Speed」という投稿がありました。DeepSeek-R1-0528の推論速度をどう改善するか、量子化やモデル並列化、キャッシュの工夫などが話題になっています。ローカルLLMの活用やコスト削減、プライバシーの観点からも興味深いです。

    • #81410 返信
      名無しさん
      量子化が一番手軽な方法だよね。GGUFやAWQで速度がかなり変わる。

      • #81411 返信
        名無しさん
        でも量子化しすぎると性能落ちるから、用途次第だな。

    • #81412 返信
      名無しさん
      DeepSeekって結構メモリ食うから、VRAM足りなくて苦労してる。

      • #81413 返信
        名無しさん
        マルチGPU使うか、CPUオフロードも検討したほうがいいかも。

    • #81414 返信
      名無しさん
      推論のバッチ処理でスループット上げる方法もあるよね。

      • #81415 返信
        名無しさん
        バッチサイズ増やすとレイテンシ増えるからトレードオフだけどな。

    • #81416 返信
      名無しさん
      自分はllama.cpp使ってる。vulkanバックエンドでちょっと速くなった。

      • #81417 返信
        名無しさん
        llama.cppの最新版でDeepSeek対応進んでる?前に試したらエラー出た。

        • #81418 返信
          名無しさん
          最近のアップデートで動くようになったみたい。自分はビルドし直したら動いた。

    • #81419 返信
      名無しさん
      こういうチューニング情報、RedditのLocalLLaMAだとよく見るけど、日本語でも欲しいね。

      • #81420 返信
        名無しさん
        確かに。でも技術情報は英語のほうが早いから、結局そっち見ちゃう。

    • #81421 返信
      名無しさん
      ベンチマーク結果もシェアしてほしい。自分の環境だとQ4_K_Mで満足してる。

      • #81422 返信
        名無しさん
        Q4_K_MとQ5_K_Mの速度差どれくらい?自分は品質優先でQ5にしてる。

13件の返信を表示中(うち親返信6件)
返信先: DeepSeek-R1-0528の推論速度改善について語ろうで#81422に返信
あなたの情報:




AA
tchmii
タイトルとURLをコピーしました