Claude Code・GPT-5.2・DeepSeek v3.2・セルフホストDevstral 2のベンチマーク比較スレ

掲示板 フォーラム AI Claude Code・GPT-5.2・DeepSeek v3.2・セルフホストDevstral 2のベンチマーク比較スレ

スレッド概要

「Claude Code・GPT-5.2・DeepSeek v3.2・セルフホストDevstral 2のベンチマーク比較スレ」についてのスレッドです。最新のSWE-rebenchでの各モデルのコーディング性能比較について、コストやプライバシー、ローカル運用の観点から意見が交わされています。 26件の返信で意見交換されています。

  • このトピックには26件の返信、8人の参加者があり、最後に名無しさんにより3年前に更新されました。
26件の返信を表示中(うち親返信11件)
  • 投稿者
    投稿
    • #70596 返信
      名無しさん
      Redditのr/LocalLLaMAで投稿されたスレッド「Claude Code, GPT-5.2, DeepSeek v3.2, and Self-Hosted Devstral 2 on Fresh SWE-rebench (November 2025)」を元にした議論です。最新のSWE-rebenchでの各モデルのコーディング性能比較について、コストやプライバシー、ローカル運用の観点から意見が交わされています。

    • #70597 返信
      名無しさん
      DeepSeek v3.2がローカルで動くってだけでかなり魅力的だよな。Claude CodeはAPI代が怖い。

      • #70599 返信
        名無しさん
        DeepSeek v3.2ってどのくらいのVRAM必要なんだ?自宅の3090で動くなら試したい。

      • #70600 返信
        名無しさん
        確かにClaude Codeは一回のタスクで何ドルも飛ぶし、ローカルで完結するなら安心。

    • #70598 返信
      名無しさん
      ベンチマークって実際の開発環境と乖離してること多いから、参考程度にしかならない気がする。

      • #70601 返信
        名無しさん
        でもベンチマークで差がついてるなら多少は指標になる。GPT-5.2が意外と健闘してるみたい。

    • #70602 返信
      名無しさん
      Devstral 2って初めて聞いたけど、セルフホストできるなら注目だな。

      • #70603 返信
        名無しさん
        Devstralは小さめのモデルだけど、コード特化で結構賢いらしい。とはいえAPIモデルには敵わないかも。

    • #70604 返信
      名無しさん
      SWE-rebenchのタスクってどんな内容なんだ?単なるコード補完じゃなくて、実際のソフトウェア工学の問題っぽいけど。

      • #70605 返信
        名無しさん
        バグ修正や機能追加とかの実践的なタスクみたい。だからこそコーディング支援の実力が測れると。

    • #70606 返信
      名無しさん
      GPT-5.2って5.1からの改善点が知りたい。DeepSeekに追い抜かれたって話もあるけど。

      • #70607 返信
        名無しさん
        OpenAIは今回のベンチマークで一番スコア高かったって見たけど、コストが半端ない。

      • #70608 返信
        名無しさん
        DeepSeekは無料で使えるし、ローカルでも動くから、コスパなら圧勝。

    • #70609 返信
      名無しさん
      個人的にはQwenとかCodeLlamaの最新版も気になる。今回の比較に入ってないのが残念。

      • #70610 返信
        名無しさん
        CodeLlama 70Bも結構優秀だけど、DeepSeek v3.2には負けるって話。

    • #70611 返信
      名無しさん
      セルフホストって言っても、それなりのGPUないと話にならないよな。クラウドのAPIの方が安上がりの場合もある。

      • #70612 返信
        名無しさん
        でも長期的に使いまくるなら、自前で持った方が安い。プライバシー面でも安心だし。

    • #70613 返信
      名無しさん
      Claude Codeって実際に使ってる人いる?自分はVS Code拡張でたまに使うけど、高額課金が怖い。

      • #70614 返信
        名無しさん
        会社のアカウントで使ってる。たしかに精度は高いけど、ちょっとした修正でもAPI呼ぶからコストかかる。

      • #70615 返信
        名無しさん
        個人利用ならDeepSeekで十分。Claude Codeはリファクタリングみたいな大規模タスクだけ。

    • #70616 返信
      名無しさん
      このベンチマーク、モデルのバージョンが古い可能性ある?DeepSeek v3.2ってリリースされたばかりだし。

      • #70617 返信
        名無しさん
        Redditのスレッドでは2025年11月時点の最新って書いてあった。たぶんその時点の最新版。

    • #70618 返信
      名無しさん
      こういう比較スレ見るたびに、結局ユースケース次第だなと思う。全部試すのは無理だし。

      • #70619 返信
        名無しさん
        そうそう。API叩きまくる人はGPTの方が楽だし、プライバシー重視はローカル。両方用意しておくのが吉。

        • #70620 返信
          名無しさん
          ハイブリッド運用が流行るんじゃない?簡単なのはローカル、難しいのはAPI。

    • #70621 返信
      名無しさん
      DeepSeek v3.2の日本語コーディング能力はどうなんだろう?英語のベンチマークばかりだと参考にならない。

      • #70622 返信
        名無しさん
        試したことあるけど、日本語の変数名やコメントはまあまあ理解してくれる。でもやっぱり英語の方が正確。

26件の返信を表示中(うち親返信11件)
返信先: Claude Code・GPT-5.2・DeepSeek v3.2・セルフホストDevstral 2のベンチマーク比較スレ
あなたの情報:




AA
tchmii
タイトルとURLをコピーしました