2025年8月収集のSWE-benchタスクでKimi-K2、DeepSeek V3.1、Qwen3-Next、Grok 4を比較 – 最新LLMのコ…

掲示板 フォーラム AI 2025年8月収集のSWE-benchタスクでKimi-K2、DeepSeek V3.1、Qwen3-Next、Grok 4を比較 – 最新LLMのコ…

スレッド概要

「2025年8月収集のSWE-benchタスクでKimi-K2、DeepSeek V3.1、Qwen3-Next、Grok 4を比較 – 最新LLMのコ…」についてのスレッドです。これは2025年8月に収集されたSWE-bench形式のタスクで、複数の最新LLMを比較したものです。 各モデルのコード生成・修正能力に焦点が当てられており、特にDeepSeek V3.1のコスパやQwen3-Nextのローカル実行の可能性、Grok 4の性能などが議論されていました。 24件の返信で意見交換されています。

  • このトピックには24件の返信、8人の参加者があり、最後に名無しさんにより2年、 11ヶ月前に更新されました。
24件の返信を表示中(うち親返信11件)
  • 投稿者
    投稿
    • #73893 返信
      名無しさん
      Redditのr/LocalLLaMAで話題になったスレッド「Kimi-K2 0905, DeepSeek V3.1, Qwen3-Next-80B-A3B, Grok 4, and others on fresh SWE-bench–style tasks collected in August 2025」の内容をまとめます。これは2025年8月に収集されたSWE-bench形式のタスクで、複数の最新LLMを比較したものです。各モデルのコード生成・修正能力に焦点が当てられており、特にDeepSeek V3.1のコスパやQwen3-Nextのローカル実行の可能性、Grok 4の性能などが議論されていました。コメント欄ではベンチマークの信頼性や実用的な使い方について様々な意見が見られました。URL:

    • #73894 返信
      名無しさん
      SWE-benchってリアルなコード修正タスクだよね。最近のモデルはどれくらい実用的なんだろう?

      • #73896 返信
        名無しさん
        SWE-benchは結構難しいから、人間の代わりになるかは微妙。でも補助ツールとしてはいいかも。

        • #73899 返信
          名無しさん
          補助ツールとしてなら、ClaudeとかGPT-4oでも十分だと思う。でもローカルで動くのは魅力。

    • #73895 返信
      名無しさん
      DeepSeek V3.1がコスパ良さそうって聞いたけど、実際どうなんだろう。API安いしローカルでも動かせるし。

      • #73898 返信
        名無しさん
        DeepSeek V3.1は確かに安いけど、ベンチマークの点数だけ見ると微妙なところもあるよ。実運用ではどうか。

        • #73904 返信
          名無しさん
          確かにベンチマークだけ見て判断するのは危険。実際にコード書かせてみないと。

    • #73897 返信
      名無しさん
      Qwen3-Next-80B-A3BってMoEモデル?ローカルで動かせるなら試したい。

      • #73901 返信
        名無しさん
        Qwen3-Nextは32BのMoEモデルだよ。アクティブパラメータ3Bだから結構軽い。

    • #73900 返信
      名無しさん
      Grok 4ってどんな感じ?Xのサブスクに入らないと使えないのがネック。

      • #73902 返信
        名無しさん
        Grok 4のコード能力は結構高いって評判だけど、課金制だしデータ収集が心配。

    • #73903 返信
      名無しさん
      ベンチマークのデータ収集時期が8月って新しいね。でもSWE-bench verifiableじゃないから過学習の可能性も。

      • #73905 返信
        名無しさん
        それな。特にオープンなベンチマークはすぐ汚染されるし、freshって言っても完全じゃない。

    • #73906 返信
      名無しさん
      Kimi-K2って中国のモデルだよね?DeepSeekと比べてどうなんだろう。

      • #73907 返信
        名無しさん
        Kimi-K2は長文コンテキストが得意らしいけど、コーディングではイマイチって話も。

    • #73908 返信
      名無しさん
      ローカルで動かすならどのモデルが一番現実的なんだろう?Qwen3-NextかDeepSeekか。

      • #73909 返信
        名無しさん
        Qwen3-Nextは量子化すれば8GB VRAMでも動くって聞いた。試してみたい。

    • #73910 返信
      名無しさん
      API使うならClaude Sonnetが安定してるけど、オープンなモデルも追いついてきたね。

      • #73911 返信
        名無しさん
        Sonnetは確かに優秀だけど、値段が高い。DeepSeek V3.1の十分の一以下で使えるなら有り。

    • #73912 返信
      名無しさん
      このスレ、英語だけど日本語でもこういう比較してほしいよね。

      • #73913 返信
        名無しさん
        日本語のコーディングベンチマークも増えてるけど、SWE-benchは汎用的だから参考になる。

    • #73914 返信
      名無しさん
      Grok 4ってX Premiumに入らないと使えないけど、値段の割に性能はどうなの?

      • #73915 返信
        名無しさん
        Grok 4はコード以外でも使えるけど、サブスクの壁が大きい。オープンなモデルで十分。

    • #73916 返信
      名無しさん
      結局、用途次第だよね。クリティカルなコードレビューは人間がやった方が安心。

      • #73917 返信
        名無しさん
        そうそう。AIはあくまで補助。でも進化は速いから数年後には変わってるかも。

24件の返信を表示中(うち親返信11件)
返信先: 2025年8月収集のSWE-benchタスクでKimi-K2、DeepSeek V3.1、Qwen3-Next、Grok 4を比較 – 最新LLMのコ…
あなたの情報:




AA
tchmii
タイトルとURLをコピーしました