スレッド概要
「DeepSeekの記憶問題について議論」についてのスレッドです。「Deepseek NEVER forgets (help please)」という投稿を見つけました。 タイトルだけだとDeepSeekが永続的に記憶を持つように見えますが、実際はコンテキスト長やメモリ管理の問題かもしれません。 21件の返信で意見交換されています。
- このトピックには21件の返信、7人の参加者があり、最後に名無しさんにより2年、 10ヶ月前に更新されました。
21件の返信を表示中(うち親返信7件)
-
投稿者投稿
-
-
名無しさん「Deepseek NEVER forgets (help please)」という投稿を見つけました。タイトルだけだとDeepSeekが永続的に記憶を持つように見えますが、実際はコンテキスト長やメモリ管理の問題かもしれません。はこちら: コメントがゼロなので、ここで自由に議論しましょう。DeepSeekモデルのローカル運用、コーディング性能、コスト、プライバシー、ベンチマーク比較など、何でもどうぞ。
-
名無しさんDeepSeekってコンテキスト長が長いって聞いたけど、記憶が残りすぎて困るのかな?
-
名無しさん確かに、会話の履歴を引きずりすぎると新しい話題に切り替えにくいことがあるよね。
-
-
名無しさん自分はDeepSeek-V3をローカルで動かしてるけど、メモリ使用量が結構大きい。コンテキストウィンドウをフルに使うと重い。
-
名無しさんどのくらいのコンテキスト長まで使ってる?私は128Kトークンだとカクつくから64Kに抑えてる。
-
名無しさん128Kでも動くけど、推論速度が落ちるね。R1の蒸留モデルは軽いからおすすめ。
-
-
-
名無しさんプライバシー面でDeepSeekは中国製だから気になる。ローカルで動かせば安心だけど、知識が古い。
-
名無しさん確かに中国製はリスクあるけど、オープンなモデルなら自分でチェックできる。Mixtralの方が安心?
-
名無しさんMixtral8x22Bは英語特化っぽい。日本語ならLlama3系の方がいいかも。
-
-
-
名無しさんコスト面ではDeepSeekのAPIは安いと聞く。でもローカルなら電気代だけだしね。
-
名無しさんAPIの方が圧倒的に早いけど、センシティブなデータは送れない。用途次第。
-
-
名無しさん「Never forgets」ってタイトルは誇張だと思う。実際はコンテキスト長の限界で古い情報は忘れる。
-
名無しさんそれでも他のモデルより記憶力が良いってことか?ベンチマークで差が出てる?
-
名無しさんMMLUやHumanEvalではDeepSeekがトップクラス。でも実用面ではLlama3.1と大差ない印象。
-
名無しさんコーディングならDeepSeek-Coderが強い。ただし日本語のコメントは若干怪しい。
-
-
-
-
名無しさん質問:DeepSeekのメモリをリセットする方法知ってる?新しいセッション始めるしかないの?
-
名無しさん大抵のフロントエンドでは「New Chat」でリセットされるよ。システムプロンプトで制御する手もある。
-
名無しさんシステムプロンプトでメモリをクリアさせるのは賢い。でもモデルが抵抗することもある。
-
-
-
名無しさん自分の環境ではDeepSeekは安定してるけど、時々古い話題を突然持ち出してびっくりする。
-
名無しさんそれ、注意力メカニズムのせいかもしれない。特定のトークンに過剰に反応してる。
-
名無しさん過学習ってこと?それともコンテキストが長すぎる弊害?
-
名無しさん両方だと思う。コンテキストが長くなると初期の情報に弱くバイアスされる現象が報告されてる。結局はトレードオフだね。
-
-
-
-
-
投稿者投稿
21件の返信を表示中(うち親返信7件)
関連するAIトピック
- DeepSeek V3でコード監査エージェント作ったってのスレ。AST解析+ハイブリッド検索でシニア級らしい。20件の返信最終更新 2023年8月3日 16:32
- DeepSeek V4とBaiduのKunlunxinチップに関するの投稿を見つけた18件の返信最終更新 2023年7月21日 15:17
- Qwenが32B/235Bベースモデルを非公開に、DeepSeekへの蒸留対策か?15件の返信最終更新 2023年10月16日 19:20
- DeepSeek-R1-Qwen3-8bのトークナイザーをQwen3 30b A3bにコピーできる?17件の返信最終更新 2023年10月16日 17:34
- DeepSeek-R1-0528-Qwen3-8BのOpenVINO量子化バージョンが公開されたらしい19件の返信最終更新 2023年10月16日 15:53