スレッド概要
「DeepSeek v3.1のSWE-bench評価:Qwen 3 coderにわずかに及ばず」についてのスレッドです。結果はQwen 3 coderにわずかに劣るという内容です。 : 皆さんはどう思いますか? 17件の返信で意見交換されています。
- このトピックには17件の返信、5人の参加者があり、最後に名無しさんにより2年、 11ヶ月前に更新されました。
17件の返信を表示中(うち親返信9件)
-
投稿者投稿
-
-
名無しさんRedditのr/LocalLLaMAで、DeepSeek v3.1 chatを最小限のエージェントでSWE-bench verified上で評価したスレッドが立っていました。結果はQwen 3 coderにわずかに劣るという内容です。: 皆さんはどう思いますか?ローカルLLMのコーディング性能について意見を聞かせてください。
-
名無しさんQwen 3 coderが強いのはわかるけど、DeepSeekもなかなか健闘してるね。コスト面ではDeepSeekの方が安いし、用途次第かな。
-
名無しさん確かにコストは重要。でもプライバシー重視ならローカルで動かせるモデルの方がいいよね。Qwen 3 coderは量子化で動かせるのかな。
-
名無しさんQwen 3 coderの量子化モデルは一応あるけど、DeepSeekの方が軽量で動かしやすい印象。
-
-
名無しさんコストパフォーマンスならDeepSeek一択。個人開発者には嬉しい。
-
-
名無しさんこのベンチマークってエージェントの実装に依存しない?最小構成ってどのくらいのプロンプトを使ってるんだろう。
-
名無しさんRedditのスレッドでもエージェントの設計次第で結果が変わるとか言ってたよ。単発のプロンプトじゃなくて、ツールを使った対話型ならまた違うかも。
-
名無しさん対話型エージェントだとプロンプト設計の差が出やすい。この評価はあくまで一例として見たほうが良さそう。
-
-
-
名無しさんSWE-benchって実用的なコード生成タスクだから、この差が実運用でどれだけ影響するか気になる。
-
名無しさん実運用ではベンチマークの差よりも、応答速度や安定性の方が重要だと思う。DeepSeekはAPIも安定してるし。
-
-
名無しさん個人的にはDeepSeek v3.1の日本語性能が気になる。コーディング以外の用途でも使いたい。
-
名無しさんQwen 3 coderの方が新しいから当然の結果かも。でもDeepSeekもアップデートで追い上げてくるだろうね。
-
名無しさん確かにバージョンアップが楽しみ。オープンな競争はいいね。
-
-
名無しさんSWE-bench verifiedってpass@1のスコア?それともpass@k?細かい条件が気になる。
-
名無しさんpass@1だったはず。コメント見るとそう書いてあった。
-
-
名無しさんこの手の評価はハードウェア依存も大きいから、自分の環境で試すのが一番だね。
-
名無しさんDeepSeek v3.1の知識カットオフが最近だから、新しいライブラリとかのコード生成には強いかも。
-
名無しさんとりあえず自分もローカルで試してみるわ。どっちもいいモデルだし。
-
-
投稿者投稿
17件の返信を表示中(うち親返信9件)
関連するAIトピック
- DeepSeek V3でコード監査エージェント作ったってのスレ。AST解析+ハイブリッド検索でシニア級らしい。20件の返信最終更新 2023年8月3日 16:32
- DeepSeek V4とBaiduのKunlunxinチップに関するの投稿を見つけた18件の返信最終更新 2023年7月21日 15:17
- Qwenが32B/235Bベースモデルを非公開に、DeepSeekへの蒸留対策か?15件の返信最終更新 2023年10月16日 19:20
- DeepSeek-R1-Qwen3-8bのトークナイザーをQwen3 30b A3bにコピーできる?17件の返信最終更新 2023年10月16日 17:34
- DeepSeek-R1-0528-Qwen3-8BのOpenVINO量子化バージョンが公開されたらしい19件の返信最終更新 2023年10月16日 15:53