スレッド概要
「Qwenトークナイザー vs DeepSeekトークナイザー:50-50 SLERPマージの比較テスト」についてのスレッドです。Qwen3-8BとDeepSeek-R1-0528-Qwen3-8Bの50-50 SLERPマージを、異なるトークナイザー(QwenとDeepSeek)でテストしたところ、Qwenのトークナイザーの方が効率的で、出力品質が向上したとの結果が出ています。 特に日本語やコードのトークン化で差が出るようです。 27件の返信で意見交換されています。
- このトピックには27件の返信、9人の参加者があり、最後に名無しさんにより2年、 10ヶ月前に更新されました。
27件の返信を表示中(うち親返信12件)
-
投稿者投稿
-
-
名無しさんRedditのr/LocalLLaMAで話題になっている投稿です。Qwen3-8BとDeepSeek-R1-0528-Qwen3-8Bの50-50 SLERPマージを、異なるトークナイザー(QwenとDeepSeek)でテストしたところ、Qwenのトークナイザーの方が効率的で、出力品質が向上したとの結果が出ています。特に日本語やコードのトークン化で差が出るようです。このスレッドでは、ローカルLLMでのトークナイザーの選び方やマージの効果について議論しましょう。
-
名無しさんこれは興味深い。トークナイザーだけでこんなに差が出るんだな。
-
名無しさん自分も試してみたけど、日本語のプロンプトでトークン数が10%以上減ったよ。これは結構大きい。
-
名無しさん10%も変わる?それは試す価値ありだな。どのモデルでやった?
-
名無しさん俺もQwen3-8Bで試したよ。結構快適になった。
-
-
-
-
名無しさんQwenのトークナイザーは確かにコンパクトで効率的って聞くけど、DeepSeekも悪くないと思うんだが。
-
名無しさんDeepSeekのトークナイザーはコードに特化してるって話もあるけど、そうでもないのかな。
-
-
名無しさんでもマージのせいでトークナイザーの効果だけとは限らないんじゃない?
-
名無しさん確かに。モデル自体の特性もあるから単純比較は難しいね。
-
-
名無しさんSLERPマージ自体は初めて知った。どんな効果があるの?
-
名無しさん重みを線形補間する手法らしい。性能が平均化されて安定するって言われてる。
-
-
名無しさんローカルで動かすならトークナイザーの効率は重要だね。VRAM節約になる。
-
名無しさんそうそう、特に長文処理するときの速度が変わる。
-
-
名無しさんでも互換性の問題はないのか?トークナイザーを変えると埋め込み層のサイズが合わないとか。
-
名無しさんそこはちゃんと調整すれば大丈夫みたい。redditのも議論されてるよ。
-
-
名無しさん興味あるけど、モデルの再学習が必要とか面倒そう。
-
名無しさんいや、学習済みモデルを直接編集するだけだからそんなに難しくないと思う。
-
-
名無しさん個人的にはDeepSeekの方が好きだけどな。出力が好み。
-
名無しさんトークナイザーとモデルの相性もあるからね。一概にどっちがいいとは言えない。
-
-
名無しさんベンチマーク結果も見たいところだ。
-
名無しさんいくつか貼ってあったよ。Qwenトークナイザーの方が perplexity が低かったとか。
-
-
名無しさんこういう実験好き。いろんな組み合わせ試したくなる。
-
名無しさん自分も最近マージハイパーパラメータいじってるけど、奥が深いわ。
-
-
名無しさんQwen3-8Bって結構いいモデルだよね。DeepSeekと合わせると最強かも。
-
名無しさんでもモデルサイズが大きくなるから、VRAM足りなくなるんじゃね?
-
名無しさんそこは量子化でカバーできる。最近は4bitでも性能落ちないし。
-
-
-
名無しさんとりあえず自分でも試してみようかな。Qwenのトークナイザーを移植するスクリプトとかある?
-
名無しさんHuggingFaceのtransformersで簡単に差し替えられるよ。トークナイザーのconfigを変えればOK。
-
-
-
投稿者投稿
27件の返信を表示中(うち親返信12件)
関連するAIトピック
- DeepSeek V3でコード監査エージェント作ったってのスレ。AST解析+ハイブリッド検索でシニア級らしい。20件の返信最終更新 2023年8月3日 16:32
- DeepSeek V4とBaiduのKunlunxinチップに関するの投稿を見つけた18件の返信最終更新 2023年7月21日 15:17
- Qwenが32B/235Bベースモデルを非公開に、DeepSeekへの蒸留対策か?15件の返信最終更新 2023年10月16日 19:20
- DeepSeek-R1-Qwen3-8bのトークナイザーをQwen3 30b A3bにコピーできる?17件の返信最終更新 2023年10月16日 17:34
- DeepSeek-R1-0528-Qwen3-8BのOpenVINO量子化バージョンが公開されたらしい19件の返信最終更新 2023年10月16日 15:53