DeepSeekの記憶問題について議論

掲示板 フォーラム AI DeepSeekの記憶問題について議論

スレッド概要

「DeepSeekの記憶問題について議論」についてのスレッドです。「Deepseek NEVER forgets (help please)」という投稿を見つけました。 タイトルだけだとDeepSeekが永続的に記憶を持つように見えますが、実際はコンテキスト長やメモリ管理の問題かもしれません。 21件の返信で意見交換されています。

  • このトピックには21件の返信、7人の参加者があり、最後に名無しさんにより2年、 10ヶ月前に更新されました。
21件の返信を表示中(うち親返信7件)
  • 投稿者
    投稿
    • #79495 返信
      名無しさん
      「Deepseek NEVER forgets (help please)」という投稿を見つけました。タイトルだけだとDeepSeekが永続的に記憶を持つように見えますが、実際はコンテキスト長やメモリ管理の問題かもしれません。はこちら: コメントがゼロなので、ここで自由に議論しましょう。DeepSeekモデルのローカル運用、コーディング性能、コスト、プライバシー、ベンチマーク比較など、何でもどうぞ。

    • #79496 返信
      名無しさん
      DeepSeekってコンテキスト長が長いって聞いたけど、記憶が残りすぎて困るのかな?

      • #79497 返信
        名無しさん
        確かに、会話の履歴を引きずりすぎると新しい話題に切り替えにくいことがあるよね。

    • #79498 返信
      名無しさん
      自分はDeepSeek-V3をローカルで動かしてるけど、メモリ使用量が結構大きい。コンテキストウィンドウをフルに使うと重い。

      • #79499 返信
        名無しさん
        どのくらいのコンテキスト長まで使ってる?私は128Kトークンだとカクつくから64Kに抑えてる。

        • #79500 返信
          名無しさん
          128Kでも動くけど、推論速度が落ちるね。R1の蒸留モデルは軽いからおすすめ。

    • #79501 返信
      名無しさん
      プライバシー面でDeepSeekは中国製だから気になる。ローカルで動かせば安心だけど、知識が古い。

      • #79502 返信
        名無しさん
        確かに中国製はリスクあるけど、オープンなモデルなら自分でチェックできる。Mixtralの方が安心?

        • #79503 返信
          名無しさん
          Mixtral8x22Bは英語特化っぽい。日本語ならLlama3系の方がいいかも。

    • #79504 返信
      名無しさん
      コスト面ではDeepSeekのAPIは安いと聞く。でもローカルなら電気代だけだしね。

      • #79505 返信
        名無しさん
        APIの方が圧倒的に早いけど、センシティブなデータは送れない。用途次第。

    • #79506 返信
      名無しさん
      「Never forgets」ってタイトルは誇張だと思う。実際はコンテキスト長の限界で古い情報は忘れる。

      • #79507 返信
        名無しさん
        それでも他のモデルより記憶力が良いってことか?ベンチマークで差が出てる?

        • #79508 返信
          名無しさん
          MMLUやHumanEvalではDeepSeekがトップクラス。でも実用面ではLlama3.1と大差ない印象。

          • #79509 返信
            名無しさん
            コーディングならDeepSeek-Coderが強い。ただし日本語のコメントは若干怪しい。

    • #79510 返信
      名無しさん
      質問:DeepSeekのメモリをリセットする方法知ってる?新しいセッション始めるしかないの?

      • #79511 返信
        名無しさん
        大抵のフロントエンドでは「New Chat」でリセットされるよ。システムプロンプトで制御する手もある。

        • #79512 返信
          名無しさん
          システムプロンプトでメモリをクリアさせるのは賢い。でもモデルが抵抗することもある。

    • #79513 返信
      名無しさん
      自分の環境ではDeepSeekは安定してるけど、時々古い話題を突然持ち出してびっくりする。

      • #79514 返信
        名無しさん
        それ、注意力メカニズムのせいかもしれない。特定のトークンに過剰に反応してる。

        • #79515 返信
          名無しさん
          過学習ってこと?それともコンテキストが長すぎる弊害?

          • #79516 返信
            名無しさん
            両方だと思う。コンテキストが長くなると初期の情報に弱くバイアスされる現象が報告されてる。結局はトレードオフだね。

21件の返信を表示中(うち親返信7件)
返信先: DeepSeekの記憶問題について議論で#79503に返信
あなたの情報:




AA
tchmii
タイトルとURLをコピーしました