スレッド概要
「DeepSeek R1 Distill Qwen3、幻覚が多いって話」についてのスレッドです。「deepseek r1 distill qwen3 Hallucinating too much」という投稿がありました。 DeepSeek の蒸留モデルが幻覚を起こしやすいという話題です。 24件の返信で意見交換されています。
- このトピックには24件の返信、8人の参加者があり、最後に名無しさんにより2年、 11ヶ月前に更新されました。
24件の返信を表示中(うち親返信10件)
-
投稿者投稿
-
-
名無しさん「deepseek r1 distill qwen3 Hallucinating too much」という投稿がありました。DeepSeek の蒸留モデルが幻覚を起こしやすいという話題です。
-
名無しさんこれ、自分も試したけど確かに幻覚多いわ。特に事実確認系でよく間違える。
-
名無しさん蒸留モデルってどうしても元モデルの性能落ちちゃうよね。
-
-
名無しさんQwen3ベースの蒸留ってのがまた微妙なのかも。
-
名無しさんQwen3自体もそんなに良くないしな。
-
-
名無しさんR1の蒸留版はみんな幻覚多いって聞く。オリジナルR1はすごいのに。
-
名無しさんオリジナルR1は大きすぎてローカルでは動かせないからな…。
-
-
名無しさんこういう話題が出ると、やっぱりローカルLLMはまだまだって思う。
-
名無しさんでも用途によるよ。コード生成とかは結構使える。
-
名無しさんコード生成も幻覚で変な関数作ることあるけどなw
-
-
-
名無しさんDeepSeekは中国のモデルだからデータセットに偏りがあるって説もある。
-
名無しさんそれで幻覚が起きやすいとか?
-
名無しさん可能性はあるね。学習データが限られてるとか。
-
-
-
名無しさん個人的にはLlama3.1の方が安定してる気がする。
-
名無しさんLlama3.1は確かにバランス良い。でもDeepSeekはコスト面で魅力的。
-
-
名無しさん蒸留モデルって精度と速度のトレードオフだよね。
-
名無しさんそうそう、速いけど賢くないっていう。
-
-
名無しさんRedditのコメントでも「temperature下げろ」ってアドバイスあったけど、それでも幻覚は減らない。
-
名無しさんtemperatureだけじゃどうにもならない問題だよね。
-
名無しさんプロンプト工夫するとか?
-
名無しさん少しはマシになるけど根本的解決にはならん。
-
-
-
-
名無しさんこんなに話題になるってことはそれだけ使われてるってことだな。
-
名無しさん確かに。無料で使えるし、ローカルで動かせるのも大きい。
-
-
名無しさん次のバージョンで改善されることを祈る。
-
名無しさんDeepSeekはアップデート頻繁だから期待できるかも。
-
-
-
投稿者投稿
24件の返信を表示中(うち親返信10件)
関連するAIトピック
- DeepSeek V3でコード監査エージェント作ったってのスレ。AST解析+ハイブリッド検索でシニア級らしい。20件の返信最終更新 2023年8月3日 16:32
- DeepSeek V4とBaiduのKunlunxinチップに関するの投稿を見つけた18件の返信最終更新 2023年7月21日 15:17
- Qwenが32B/235Bベースモデルを非公開に、DeepSeekへの蒸留対策か?15件の返信最終更新 2023年10月16日 19:20
- DeepSeek-R1-Qwen3-8bのトークナイザーをQwen3 30b A3bにコピーできる?17件の返信最終更新 2023年10月16日 17:34
- DeepSeek-R1-0528-Qwen3-8BのOpenVINO量子化バージョンが公開されたらしい19件の返信最終更新 2023年10月16日 15:53