DeepSeek V3.1、マルチプレイヤーStep Gameの社会推論ベンチマークで性能向上

掲示板 フォーラム AI DeepSeek V3.1、マルチプレイヤーStep Gameの社会推論ベンチマークで性能向上

スレッド概要

「DeepSeek V3.1、マルチプレイヤーStep Gameの社会推論ベンチマークで性能向上」についてのスレッドです。このモデルはマルチプレイヤーのステップゲームにおける社会的推論ベンチマークで改善が見られたとのこと。 、ベンチマークの有意性や実際の応用可能性について様々な意見が交わされていました。 18件の返信で意見交換されています。

  • このトピックには18件の返信、6人の参加者があり、最後に名無しさんにより2年、 11ヶ月前に更新されました。
18件の返信を表示中(うち親返信10件)
  • 投稿者
    投稿
    • #77328 返信
      名無しさん
      Redditの 話題になっていたDeepSeek V3.1に関する投稿をまとめます。このモデルはマルチプレイヤーのステップゲームにおける社会的推論ベンチマークで改善が見られたとのこと。、ベンチマークの有意性や実際の応用可能性について様々な意見が交わされていました。

    • #77329 返信
      名無しさん
      ゲーム理論的なベンチマークか。面白いけど実際の会話能力とどれだけ相関があるのか気になる。

      • #77331 返信
        名無しさん
        社会的推論って言うほど重要なのか?使ってみたいけど、日本語の性能はどうなんだろう。

        • #77335 返信
          名無しさん
          日本語はGPT-4oとかClaudeのが安定してる印象。でもDeepSeekはコード生成に強いんだよね。

          • #77339 返信
            名無しさん
            コード生成なら確かにDeepSeekは上位だよね。GPT-4o miniより安いし。

    • #77330 返信
      名無しさん
      DeepSeekってやっぱりコスパ良いよな。V3.1ならさらに安くなってるのか?

      • #77333 返信
        名無しさん
        そうそう、APIの値下げが嬉しい。ローカルで動かすより手軽だし。

    • #77332 返信
      名無しさん
      こういうベンチマークって過学習してる可能性もあるから、ちゃんと見極めないとね。

      • #77337 返信
        名無しさん
        過学習の懸念はあるけど、ベンチマークだけじゃなくて実タスクでも評価してほしいな。

    • #77334 返信
      名無しさん
      ステップゲームって初めて聞いたわ。調べてみよう。

    • #77336 返信
      名無しさん
      プライバシー面だとDeepSeekは中国製だから気になるって人もいるみたい。

      • #77341 返信
        名無しさん
        データが中国に送られるかもってのが気になるなら、ローカルLLM使う方が安全かもね。

    • #77338 返信
      名無しさん
      個人的にはV3で十分満足してるけど、V3.1はどれくらい変わったんだろう。

    • #77340 返信
      名無しさん
      こういうマルチプレイヤーの推論って、マルチエージェントシステムに応用できそう。

      • #77343 返信
        名無しさん
        実際に組み合わせて使ってみたいけど、まだノウハウが足りない。

    • #77342 返信
      名無しさん
      OSSでモデル公開されてるから、自分で検証できるのがいいよね。

    • #77344 返信
      名無しさん
      ベンチマークスコアだけじゃなくて、実例で見せてくれるとわかりやすいのに。

    • #77345 返信
      名無しさん
      とりあえず試してみるか。API使えばすぐ試せるし。

      • #77346 返信
        名無しさん
        試したらレポート頼む。どんな感じだったか教えてほしい。

18件の返信を表示中(うち親返信10件)
返信先: DeepSeek V3.1、マルチプレイヤーStep Gameの社会推論ベンチマークで性能向上
あなたの情報:




AA
tchmii
タイトルとURLをコピーしました