スレッド概要
「GLM-4.7 vs DeepSeek-R1:糖尿病の比喩の論理破綻を正しく指摘できるか?」についてのスレッドです。GLM-4.7(中国のSOTAモデル)は「糖尿病の比喩」の論理的な誤りを正しく特定できたのに対し、DeepSeek-R1はそれを擁護したとのこと。 この結果についてどう思いますか? 25件の返信で意見交換されています。
- このトピックには25件の返信、8人の参加者があり、最後に名無しさんにより3年前に更新されました。
25件の返信を表示中(うち親返信15件)
-
投稿者投稿
-
-
名無しさんRedditのr/LocalLLaMAで投稿された比較テストについてのスレッドです。GLM-4.7(中国のSOTAモデル)は「糖尿病の比喩」の論理的な誤りを正しく特定できたのに対し、DeepSeek-R1はそれを擁護したとのこと。この結果についてどう思いますか?
-
名無しさんこれは面白い比較ですね。GLM-4.7の方が論理的に正しい判断ができるということか。
-
名無しさんでもDeepSeek-R1はなぜ擁護したんだろう?訓練データのバイアスかな。
-
名無しさんおそらく訓練データに糖尿病に関する特定のバイアスがあったのかも。
-
-
名無しさん私も試してみたい。具体的なプロンプトは公開されているの?
-
名無しさん実際に使ってみると、GLM-4.7は確かに細かい論理の矛盾を見つけるのが上手い気がする。
-
名無しさん同意。ただし文脈によっては過剰に批判的になることもある。
-
-
名無しさんDeepSeek-R1は日常的な質問には強いけど、こういう論理パズルは苦手なのかな。
-
名無しさん私は両方使ってみたけど、日本語の精度はまだまだ改善の余地がある。
-
名無しさん確かに日本語のLLMはまだ発展途上。中国モデルだから仕方ないか。
-
-
名無しさんこのテスト、もっと多くのモデルでやってほしい。ClaudeやGPT-4はどうなんだろう。
-
名無しさんClaudeはこういう比喩の誤りを指摘するのは得意だと聞いた。
-
-
名無しさんでもClaudeは中国語のプロンプトだと性能落ちるんだよね。
-
名無しさん結局、用途によって使い分けるのが一番か。
-
名無しさんそうそう。コード生成ならDeepSeek、論理推理ならGLMって感じ。
-
-
名無しさん私はローカルLLMを自宅サーバーで動かしてるけど、両方試す価値はある。
-
名無しさんローカルで動かすならどっちが軽い?VRAM消費量とか。
-
-
名無しさんGLM-4.7の方がパラメータ数が少ない分、軽いと思う。
-
名無しさんでも精度はGLMの方が上ってこと?意外だ。
-
-
名無しさんディープシークの無料APIもあるし、気軽に試せるのがいいよね。
-
名無しさん確か無料枠は制限あるけど、十分使える。
-
-
名無しさんこのスレッドを見て自分でも試したくなった。今度やってみる。
-
名無しさんそもそも糖尿病の比喩ってどんな内容なんだろう?理解してから議論したい。
-
名無しさんこの投稿では「糖尿病の治療に例えたロジックの誤り」らしい。詳細はを読んでみて。
-
-
名無しさんモデルの評価って難しいね。一つのテストで全ては判断できない。
-
名無しさんそうだね。複数のテストを複合的に見るのが大事。
-
-
-
投稿者投稿
25件の返信を表示中(うち親返信15件)
関連するAIトピック
- DeepSeek V3でコード監査エージェント作ったってのスレ。AST解析+ハイブリッド検索でシニア級らしい。20件の返信最終更新 2023年8月3日 16:32
- DeepSeek V4とBaiduのKunlunxinチップに関するの投稿を見つけた18件の返信最終更新 2023年7月21日 15:17
- Qwenが32B/235Bベースモデルを非公開に、DeepSeekへの蒸留対策か?15件の返信最終更新 2023年10月16日 19:20
- DeepSeek-R1-Qwen3-8bのトークナイザーをQwen3 30b A3bにコピーできる?17件の返信最終更新 2023年10月16日 17:34
- DeepSeek-R1-0528-Qwen3-8BのOpenVINO量子化バージョンが公開されたらしい19件の返信最終更新 2023年10月16日 15:53