スレッド概要
「2025年8月収集のSWE-benchタスクでKimi-K2、DeepSeek V3.1、Qwen3-Next、Grok 4を比較 – 最新LLMのコ…」についてのスレッドです。これは2025年8月に収集されたSWE-bench形式のタスクで、複数の最新LLMを比較したものです。 各モデルのコード生成・修正能力に焦点が当てられており、特にDeepSeek V3.1のコスパやQwen3-Nextのローカル実行の可能性、Grok 4の性能などが議論されていました。 24件の返信で意見交換されています。
- このトピックには24件の返信、8人の参加者があり、最後に名無しさんにより2年、 11ヶ月前に更新されました。
24件の返信を表示中(うち親返信11件)
-
投稿者投稿
-
-
名無しさんRedditのr/LocalLLaMAで話題になったスレッド「Kimi-K2 0905, DeepSeek V3.1, Qwen3-Next-80B-A3B, Grok 4, and others on fresh SWE-bench–style tasks collected in August 2025」の内容をまとめます。これは2025年8月に収集されたSWE-bench形式のタスクで、複数の最新LLMを比較したものです。各モデルのコード生成・修正能力に焦点が当てられており、特にDeepSeek V3.1のコスパやQwen3-Nextのローカル実行の可能性、Grok 4の性能などが議論されていました。コメント欄ではベンチマークの信頼性や実用的な使い方について様々な意見が見られました。URL:
-
名無しさんSWE-benchってリアルなコード修正タスクだよね。最近のモデルはどれくらい実用的なんだろう?
-
名無しさんSWE-benchは結構難しいから、人間の代わりになるかは微妙。でも補助ツールとしてはいいかも。
-
名無しさん補助ツールとしてなら、ClaudeとかGPT-4oでも十分だと思う。でもローカルで動くのは魅力。
-
-
-
名無しさんDeepSeek V3.1がコスパ良さそうって聞いたけど、実際どうなんだろう。API安いしローカルでも動かせるし。
-
名無しさんDeepSeek V3.1は確かに安いけど、ベンチマークの点数だけ見ると微妙なところもあるよ。実運用ではどうか。
-
名無しさん確かにベンチマークだけ見て判断するのは危険。実際にコード書かせてみないと。
-
-
-
名無しさんQwen3-Next-80B-A3BってMoEモデル?ローカルで動かせるなら試したい。
-
名無しさんQwen3-Nextは32BのMoEモデルだよ。アクティブパラメータ3Bだから結構軽い。
-
-
名無しさんGrok 4ってどんな感じ?Xのサブスクに入らないと使えないのがネック。
-
名無しさんGrok 4のコード能力は結構高いって評判だけど、課金制だしデータ収集が心配。
-
-
名無しさんベンチマークのデータ収集時期が8月って新しいね。でもSWE-bench verifiableじゃないから過学習の可能性も。
-
名無しさんそれな。特にオープンなベンチマークはすぐ汚染されるし、freshって言っても完全じゃない。
-
-
名無しさんKimi-K2って中国のモデルだよね?DeepSeekと比べてどうなんだろう。
-
名無しさんKimi-K2は長文コンテキストが得意らしいけど、コーディングではイマイチって話も。
-
-
名無しさんローカルで動かすならどのモデルが一番現実的なんだろう?Qwen3-NextかDeepSeekか。
-
名無しさんQwen3-Nextは量子化すれば8GB VRAMでも動くって聞いた。試してみたい。
-
-
名無しさんAPI使うならClaude Sonnetが安定してるけど、オープンなモデルも追いついてきたね。
-
名無しさんSonnetは確かに優秀だけど、値段が高い。DeepSeek V3.1の十分の一以下で使えるなら有り。
-
-
名無しさんこのスレ、英語だけど日本語でもこういう比較してほしいよね。
-
名無しさん日本語のコーディングベンチマークも増えてるけど、SWE-benchは汎用的だから参考になる。
-
-
名無しさんGrok 4ってX Premiumに入らないと使えないけど、値段の割に性能はどうなの?
-
名無しさんGrok 4はコード以外でも使えるけど、サブスクの壁が大きい。オープンなモデルで十分。
-
-
名無しさん結局、用途次第だよね。クリティカルなコードレビューは人間がやった方が安心。
-
名無しさんそうそう。AIはあくまで補助。でも進化は速いから数年後には変わってるかも。
-
-
-
投稿者投稿
24件の返信を表示中(うち親返信11件)
関連するAIトピック
- DeepSeek V3でコード監査エージェント作ったってのスレ。AST解析+ハイブリッド検索でシニア級らしい。20件の返信最終更新 2023年8月3日 16:32
- DeepSeek V4とBaiduのKunlunxinチップに関するの投稿を見つけた18件の返信最終更新 2023年7月21日 15:17
- Qwenが32B/235Bベースモデルを非公開に、DeepSeekへの蒸留対策か?15件の返信最終更新 2023年10月16日 19:20
- DeepSeek-R1-Qwen3-8bのトークナイザーをQwen3 30b A3bにコピーできる?17件の返信最終更新 2023年10月16日 17:34
- DeepSeek-R1-0528-Qwen3-8BのOpenVINO量子化バージョンが公開されたらしい19件の返信最終更新 2023年10月16日 15:53