DeepSeek v3.1がAiderで71.6%達成、非推論系SOTAに

掲示板 フォーラム AI DeepSeek v3.1がAiderで71.6%達成、非推論系SOTAに

スレッド概要

「DeepSeek v3.1がAiderで71.6%達成、非推論系SOTAに」についてのスレッドです。コード生成の実用的な性能として注目されているみたいですが、実際に使った人の感想や他モデルとの比較など、意見を聞かせてください。 25件の返信で意見交換されています。

  • このトピックには25件の返信、8人の参加者があり、最後に名無しさんにより2年、 11ヶ月前に更新されました。
25件の返信を表示中(うち親返信13件)
  • 投稿者
    投稿
    • #77948 返信
      名無しさん
      Redditのr/LocalLLaMAで話題になっていたDeepSeek v3.1のAiderベンチマークスコアが71.6%で、非推論系モデルとしてはSOTAだそうです。
      コード生成の実用的な性能として注目されているみたいですが、実際に使った人の感想や他モデルとの比較など、意見を聞かせてください。

    • #77949 返信
      名無しさん
      71.6%って結構高いな。ただしAiderのベンチマークってタスクの種類によってスコア変わるから、一概に凄いとは言えない気がする。

      • #77951 返信
        名無しさん
        たしかにAiderのベンチは単純なコード補完が多くて、複雑なロジックは測れてないって話もある。

    • #77950 返信
      名無しさん
      非推論系ってのがミソだよね。推論ありのo1とかと比べるとまだ差があるけど、コスパは良さそう。

    • #77952 返信
      名無しさん
      DeepSeekはAPI安いし、ローカルでも動かせるから嬉しい。V3.1は前よりマルチターンが改善してるとか?

      • #77953 返信
        名無しさん
        ローカルで動かすにはまだVRAM必要だけど、8bit量子化でなんとかRTX3090でも動くらしい。

    • #77954 返信
      名無しさん
      これって中国のモデルだからデータのプライバシーが気になる人もいるよね。API使うのはちょっと躊躇する。

      • #77955 返信
        名無しさん
        ローカルで動かせばデータ漏洩は防げるけど、それならLlamaとか使う方が安心かも?

    • #77956 返信
      名無しさん
      Aiderのスコアってコード生成の品質を測るのに適切なんだろうか?実務で使ってみたら意外とハルシネーションが多かったり。

      • #77957 返信
        名無しさん
        確かにベンチマークは参考程度で、実際のプロジェクトで使ってみないとわからない部分はある。

    • #77958 返信
      名無しさん
      Qwen2.5-Coderと比べてどうなんだろう?自分はQwenの方が日本語のコードコメントが自然で好き。

      • #77959 返信
        名無しさん
        日本語だとDeepSeekは中国語ベースだからか、たまに変なが混ざると聞いた。

    • #77960 返信
      名無しさん
      個人的にはClaude Haiku使ってるけど、DeepSeekの方がコスパ良いなら乗り換えようかな。

      • #77961 返信
        名無しさん
        単価は安いけど、応答が遅いときがあるから注意。特に夜間は混んでる。

    • #77962 返信
      名無しさん
      AiderってなんかあのVSCodeの拡張?使ったことないけど便利なのかな。

      • #77963 返信
        名無しさん
        Aiderはコード生成エージェントで、ターミナルから使うやつ。VSCode拡張は別にあるかも。結構便利。

    • #77964 返信
      名無しさん
      DeepSeekはバージョンアップが早くて追いつくのが大変。次はもうV3.2が出るらしい。

      • #77965 返信
        名無しさん
        マジか、じゃあ今はV3.1でもすぐに古くなるから、深くハマらない方がいいかも。

    • #77966 返信
      名無しさん
      非推論系ってことは、推論モデルに比べて応答が速いってこと?それなら実用的だね。

      • #77967 返信
        名無しさん
        そう、推論モデルは内部で自己検証するから遅いけど、DeepSeek v3.1はストリート感覚でパパッとコード書いてくれる。

    • #77968 返信
      名無しさん
      でも71.6%って、100点満点じゃないし、残り30%近くは間違ったコードを生成しているってことだよね。そこが怖い。

      • #77969 返信
        名無しさん
        人間でも完璧ではないし、生成されたコードはレビュー必須ってことで。

    • #77970 返信
      名無しさん
      Aiderのベンチマークってオープンだから自分でも実行できるんだよね。試してみようかな。

      • #77971 返信
        名無しさん
        試すならAPIキーが必要だけど、DeepSeekのAPIなら無料枠あるからおすすめ。

    • #77972 返信
      名無しさん
      正直Claude Sonnetのほうが自分の使い方には合ってるけど、DeepSeekの進化は見逃せない。

      • #77973 返信
        名無しさん
        用途によるよね。私はタスクにはDeepSeek使ってるけど、コードはClaudeの方が信頼できる。

25件の返信を表示中(うち親返信13件)
返信先: DeepSeek v3.1がAiderで71.6%達成、非推論系SOTAに
あなたの情報:




AA
tchmii
タイトルとURLをコピーしました