スレッド概要
「DeepSeek-7BでAnthropicの内省論文を再現できたという話」についてのスレッドです。「Anthropicの内省(Introspection)ペーパーをDeepSeek-7Bで再現した。 うまくいった。 21件の返信で意見交換されています。
- このトピックには21件の返信、7人の参加者があり、最後に名無しさんにより3年前に更新されました。
21件の返信を表示中(うち親返信8件)
-
投稿者投稿
-
-
名無しさん「Anthropicの内省(Introspection)ペーパーをDeepSeek-7Bで再現した。うまくいった。」という投稿がありました。スコア249、コメント32件。再現性や他のモデルとの比較、ローカルLLMの実用性について議論が交わされています。
-
名無しさんこれすごいな。DeepSeekはコスパいいし、ローカルで動かせるのが魅力だね。
-
名無しさんでも再現性ってどうなの?自分で試したら意外と再現できなかったって話も聞くけど。
-
名無しさん確かにAnthropicの論文は再現が難しいってよく言われる。でも今回はDeepSeekでできたって報告だから、モデル依存かもしれないね。
-
-
-
名無しさん内省って具体的にどういう手法?自己修正とかそういうやつ?
-
名無しさんモデルに自分の出力を説明させて、間違いを認識させるっていうアプローチらしいよ。Anthropicが発表したやつ。
-
名無しさんなるほど。でも7Bパラメータでそこまでできるんだね。もっと大きなモデルじゃないと無理かと思ってた。
-
-
-
名無しさんDeepSeekって中国製だからプライバシー的に不安って人もいるよね。でもローカルなら安心か。
-
名無しさんローカルで使う分には関係ないけど、公式のAPI使うなら気になるかも。
-
-
名無しさんベンチマークでDeepSeekがLlamaに勝ってるって聞いたけど、この内省タスクでも差が出るのかな。
-
名無しさん多分コードとか論理推論で強いんだと思う。内省もその延長かも。
-
名無しさんLlamaでも再現試みてる人いるのかな?気になる。
-
-
-
名無しさんこの投稿者、コード公開してくれてる?GitHubとか。
-
名無しさん元のRedditのコメント見たら、まだ公開してないけど準備中らしい。
-
名無しさん公開されたら試してみたいな。消費メモリどのくらい?
-
-
-
名無しさん内省って結局はチェーン・オブ・ソートの一種じゃない?あんまり新しくない気がする。
-
名無しさん確かに既存手法の焼き直し感はあるけど、Anthropicはちゃんと論文にしてるし価値はあるよ。
-
名無しさんでも再現できたっていうのはいい知らせだね。OSSコミュニティの力って感じ。
-
-
-
名無しさんDeepSeekってコーディングタスクで強いイメージあるけど、こういう研究寄りのこともできるんだ。
-
名無しさんむしろ内省はコード生成の品質向上にも使えるかもしれない。自己修正ループとか。
-
-
名無しさんでも7Bだと実用的な応用にはまだ厳しいんじゃない?70Bとかで試さないと。
-
名無しさん規模の問題じゃなくて、手法の有効性を示したって意味では良いと思うよ。
-
-
-
投稿者投稿
21件の返信を表示中(うち親返信8件)
関連するAIトピック
- DeepSeek V3でコード監査エージェント作ったってのスレ。AST解析+ハイブリッド検索でシニア級らしい。20件の返信最終更新 2023年8月3日 16:32
- DeepSeek V4とBaiduのKunlunxinチップに関するの投稿を見つけた18件の返信最終更新 2023年7月21日 15:17
- Qwenが32B/235Bベースモデルを非公開に、DeepSeekへの蒸留対策か?15件の返信最終更新 2023年10月16日 19:20
- DeepSeek-R1-Qwen3-8bのトークナイザーをQwen3 30b A3bにコピーできる?17件の返信最終更新 2023年10月16日 17:34
- DeepSeek-R1-0528-Qwen3-8BのOpenVINO量子化バージョンが公開されたらしい19件の返信最終更新 2023年10月16日 15:53