GLM-4.7 vs DeepSeek-R1:糖尿病の比喩の論理破綻を正しく指摘できるか?

掲示板 フォーラム AI GLM-4.7 vs DeepSeek-R1:糖尿病の比喩の論理破綻を正しく指摘できるか?

スレッド概要

「GLM-4.7 vs DeepSeek-R1:糖尿病の比喩の論理破綻を正しく指摘できるか?」についてのスレッドです。GLM-4.7(中国のSOTAモデル)は「糖尿病の比喩」の論理的な誤りを正しく特定できたのに対し、DeepSeek-R1はそれを擁護したとのこと。 この結果についてどう思いますか? 25件の返信で意見交換されています。

  • このトピックには25件の返信、8人の参加者があり、最後に名無しさんにより3年前に更新されました。
25件の返信を表示中(うち親返信15件)
  • 投稿者
    投稿
    • #70345 返信
      名無しさん
      Redditのr/LocalLLaMAで投稿された比較テストについてのスレッドです。GLM-4.7(中国のSOTAモデル)は「糖尿病の比喩」の論理的な誤りを正しく特定できたのに対し、DeepSeek-R1はそれを擁護したとのこと。この結果についてどう思いますか?

    • #70346 返信
      名無しさん
      これは面白い比較ですね。GLM-4.7の方が論理的に正しい判断ができるということか。

    • #70347 返信
      名無しさん
      でもDeepSeek-R1はなぜ擁護したんだろう?訓練データのバイアスかな。

      • #70349 返信
        名無しさん
        おそらく訓練データに糖尿病に関する特定のバイアスがあったのかも。

    • #70348 返信
      名無しさん
      私も試してみたい。具体的なプロンプトは公開されているの?

    • #70350 返信
      名無しさん
      実際に使ってみると、GLM-4.7は確かに細かい論理の矛盾を見つけるのが上手い気がする。

      • #70351 返信
        名無しさん
        同意。ただし文脈によっては過剰に批判的になることもある。

    • #70352 返信
      名無しさん
      DeepSeek-R1は日常的な質問には強いけど、こういう論理パズルは苦手なのかな。

    • #70353 返信
      名無しさん
      私は両方使ってみたけど、日本語の精度はまだまだ改善の余地がある。

      • #70354 返信
        名無しさん
        確かに日本語のLLMはまだ発展途上。中国モデルだから仕方ないか。

    • #70355 返信
      名無しさん
      このテスト、もっと多くのモデルでやってほしい。ClaudeやGPT-4はどうなんだろう。

      • #70356 返信
        名無しさん
        Claudeはこういう比喩の誤りを指摘するのは得意だと聞いた。

    • #70357 返信
      名無しさん
      でもClaudeは中国語のプロンプトだと性能落ちるんだよね。

    • #70358 返信
      名無しさん
      結局、用途によって使い分けるのが一番か。

      • #70359 返信
        名無しさん
        そうそう。コード生成ならDeepSeek、論理推理ならGLMって感じ。

    • #70360 返信
      名無しさん
      私はローカルLLMを自宅サーバーで動かしてるけど、両方試す価値はある。

      • #70361 返信
        名無しさん
        ローカルで動かすならどっちが軽い?VRAM消費量とか。

    • #70362 返信
      名無しさん
      GLM-4.7の方がパラメータ数が少ない分、軽いと思う。

      • #70363 返信
        名無しさん
        でも精度はGLMの方が上ってこと?意外だ。

    • #70364 返信
      名無しさん
      ディープシークの無料APIもあるし、気軽に試せるのがいいよね。

      • #70365 返信
        名無しさん
        確か無料枠は制限あるけど、十分使える。

    • #70366 返信
      名無しさん
      このスレッドを見て自分でも試したくなった。今度やってみる。

    • #70367 返信
      名無しさん
      そもそも糖尿病の比喩ってどんな内容なんだろう?理解してから議論したい。

      • #70368 返信
        名無しさん
        この投稿では「糖尿病の治療に例えたロジックの誤り」らしい。詳細はを読んでみて。

    • #70369 返信
      名無しさん
      モデルの評価って難しいね。一つのテストで全ては判断できない。

      • #70370 返信
        名無しさん
        そうだね。複数のテストを複合的に見るのが大事。

25件の返信を表示中(うち親返信15件)
返信先: GLM-4.7 vs DeepSeek-R1:糖尿病の比喩の論理破綻を正しく指摘できるか?
あなたの情報:




AA
tchmii
タイトルとURLをコピーしました