DeepSeek v3.1のSWE-bench評価:Qwen 3 coderにわずかに及ばず

掲示板 フォーラム AI DeepSeek v3.1のSWE-bench評価:Qwen 3 coderにわずかに及ばず

スレッド概要

「DeepSeek v3.1のSWE-bench評価:Qwen 3 coderにわずかに及ばず」についてのスレッドです。結果はQwen 3 coderにわずかに劣るという内容です。 : 皆さんはどう思いますか? 17件の返信で意見交換されています。

  • このトピックには17件の返信、5人の参加者があり、最後に名無しさんにより2年、 11ヶ月前に更新されました。
17件の返信を表示中(うち親返信9件)
  • 投稿者
    投稿
    • #74875 返信
      名無しさん
      Redditのr/LocalLLaMAで、DeepSeek v3.1 chatを最小限のエージェントでSWE-bench verified上で評価したスレッドが立っていました。結果はQwen 3 coderにわずかに劣るという内容です。: 皆さんはどう思いますか?ローカルLLMのコーディング性能について意見を聞かせてください。

    • #74876 返信
      名無しさん
      Qwen 3 coderが強いのはわかるけど、DeepSeekもなかなか健闘してるね。コスト面ではDeepSeekの方が安いし、用途次第かな。

      • #74878 返信
        名無しさん
        確かにコストは重要。でもプライバシー重視ならローカルで動かせるモデルの方がいいよね。Qwen 3 coderは量子化で動かせるのかな。

        • #74886 返信
          名無しさん
          Qwen 3 coderの量子化モデルは一応あるけど、DeepSeekの方が軽量で動かしやすい印象。

      • #74884 返信
        名無しさん
        コストパフォーマンスならDeepSeek一択。個人開発者には嬉しい。

    • #74877 返信
      名無しさん
      このベンチマークってエージェントの実装に依存しない?最小構成ってどのくらいのプロンプトを使ってるんだろう。

      • #74880 返信
        名無しさん
        Redditのスレッドでもエージェントの設計次第で結果が変わるとか言ってたよ。単発のプロンプトじゃなくて、ツールを使った対話型ならまた違うかも。

        • #74888 返信
          名無しさん
          対話型エージェントだとプロンプト設計の差が出やすい。この評価はあくまで一例として見たほうが良さそう。

    • #74879 返信
      名無しさん
      SWE-benchって実用的なコード生成タスクだから、この差が実運用でどれだけ影響するか気になる。

      • #74882 返信
        名無しさん
        実運用ではベンチマークの差よりも、応答速度や安定性の方が重要だと思う。DeepSeekはAPIも安定してるし。

    • #74881 返信
      名無しさん
      個人的にはDeepSeek v3.1の日本語性能が気になる。コーディング以外の用途でも使いたい。

    • #74883 返信
      名無しさん
      Qwen 3 coderの方が新しいから当然の結果かも。でもDeepSeekもアップデートで追い上げてくるだろうね。

      • #74890 返信
        名無しさん
        確かにバージョンアップが楽しみ。オープンな競争はいいね。

    • #74885 返信
      名無しさん
      SWE-bench verifiedってpass@1のスコア?それともpass@k?細かい条件が気になる。

      • #74892 返信
        名無しさん
        pass@1だったはず。コメント見るとそう書いてあった。

    • #74887 返信
      名無しさん
      この手の評価はハードウェア依存も大きいから、自分の環境で試すのが一番だね。

    • #74889 返信
      名無しさん
      DeepSeek v3.1の知識カットオフが最近だから、新しいライブラリとかのコード生成には強いかも。

    • #74891 返信
      名無しさん
      とりあえず自分もローカルで試してみるわ。どっちもいいモデルだし。

17件の返信を表示中(うち親返信9件)
返信先: DeepSeek v3.1のSWE-bench評価:Qwen 3 coderにわずかに及ばずで#74881に返信
あなたの情報:




AA
tchmii
タイトルとURLをコピーしました