Qwenトークナイザー vs DeepSeekトークナイザー:50-50 SLERPマージの比較テスト

掲示板 フォーラム AI Qwenトークナイザー vs DeepSeekトークナイザー:50-50 SLERPマージの比較テスト

スレッド概要

「Qwenトークナイザー vs DeepSeekトークナイザー:50-50 SLERPマージの比較テスト」についてのスレッドです。Qwen3-8BとDeepSeek-R1-0528-Qwen3-8Bの50-50 SLERPマージを、異なるトークナイザー(QwenとDeepSeek)でテストしたところ、Qwenのトークナイザーの方が効率的で、出力品質が向上したとの結果が出ています。 特に日本語やコードのトークン化で差が出るようです。 27件の返信で意見交換されています。

  • このトピックには27件の返信、9人の参加者があり、最後に名無しさんにより2年、 10ヶ月前に更新されました。
27件の返信を表示中(うち親返信12件)
  • 投稿者
    投稿
    • #80414 返信
      名無しさん
      Redditのr/LocalLLaMAで話題になっている投稿です。Qwen3-8BとDeepSeek-R1-0528-Qwen3-8Bの50-50 SLERPマージを、異なるトークナイザー(QwenとDeepSeek)でテストしたところ、Qwenのトークナイザーの方が効率的で、出力品質が向上したとの結果が出ています。特に日本語やコードのトークン化で差が出るようです。このスレッドでは、ローカルLLMでのトークナイザーの選び方やマージの効果について議論しましょう。

    • #80415 返信
      名無しさん
      これは興味深い。トークナイザーだけでこんなに差が出るんだな。

      • #80417 返信
        名無しさん
        自分も試してみたけど、日本語のプロンプトでトークン数が10%以上減ったよ。これは結構大きい。

        • #80425 返信
          名無しさん
          10%も変わる?それは試す価値ありだな。どのモデルでやった?

          • #80426 返信
            名無しさん
            俺もQwen3-8Bで試したよ。結構快適になった。

    • #80416 返信
      名無しさん
      Qwenのトークナイザーは確かにコンパクトで効率的って聞くけど、DeepSeekも悪くないと思うんだが。

      • #80420 返信
        名無しさん
        DeepSeekのトークナイザーはコードに特化してるって話もあるけど、そうでもないのかな。

    • #80418 返信
      名無しさん
      でもマージのせいでトークナイザーの効果だけとは限らないんじゃない?

      • #80419 返信
        名無しさん
        確かに。モデル自体の特性もあるから単純比較は難しいね。

    • #80421 返信
      名無しさん
      SLERPマージ自体は初めて知った。どんな効果があるの?

      • #80422 返信
        名無しさん
        重みを線形補間する手法らしい。性能が平均化されて安定するって言われてる。

    • #80423 返信
      名無しさん
      ローカルで動かすならトークナイザーの効率は重要だね。VRAM節約になる。

      • #80424 返信
        名無しさん
        そうそう、特に長文処理するときの速度が変わる。

    • #80427 返信
      名無しさん
      でも互換性の問題はないのか?トークナイザーを変えると埋め込み層のサイズが合わないとか。

      • #80428 返信
        名無しさん
        そこはちゃんと調整すれば大丈夫みたい。redditのも議論されてるよ。

    • #80429 返信
      名無しさん
      興味あるけど、モデルの再学習が必要とか面倒そう。

      • #80430 返信
        名無しさん
        いや、学習済みモデルを直接編集するだけだからそんなに難しくないと思う。

    • #80431 返信
      名無しさん
      個人的にはDeepSeekの方が好きだけどな。出力が好み。

      • #80432 返信
        名無しさん
        トークナイザーとモデルの相性もあるからね。一概にどっちがいいとは言えない。

    • #80433 返信
      名無しさん
      ベンチマーク結果も見たいところだ。

      • #80434 返信
        名無しさん
        いくつか貼ってあったよ。Qwenトークナイザーの方が perplexity が低かったとか。

    • #80435 返信
      名無しさん
      こういう実験好き。いろんな組み合わせ試したくなる。

      • #80436 返信
        名無しさん
        自分も最近マージハイパーパラメータいじってるけど、奥が深いわ。

    • #80437 返信
      名無しさん
      Qwen3-8Bって結構いいモデルだよね。DeepSeekと合わせると最強かも。

      • #80438 返信
        名無しさん
        でもモデルサイズが大きくなるから、VRAM足りなくなるんじゃね?

        • #80439 返信
          名無しさん
          そこは量子化でカバーできる。最近は4bitでも性能落ちないし。

    • #80440 返信
      名無しさん
      とりあえず自分でも試してみようかな。Qwenのトークナイザーを移植するスクリプトとかある?

      • #80441 返信
        名無しさん
        HuggingFaceのtransformersで簡単に差し替えられるよ。トークナイザーのconfigを変えればOK。

27件の返信を表示中(うち親返信12件)
返信先: Qwenトークナイザー vs DeepSeekトークナイザー:50-50 SLERPマージの比較テスト
あなたの情報:




AA
tchmii
タイトルとURLをコピーしました