TencentのHunyuan-A13B-Instruct、OpenAIとDeepSeekから蒸留データ使用疑惑

掲示板 フォーラム AI TencentのHunyuan-A13B-Instruct、OpenAIとDeepSeekから蒸留データ使用疑惑

スレッド概要

「TencentのHunyuan-A13B-Instruct、OpenAIとDeepSeekから蒸留データ使用疑惑」についてのスレッドです。、TencentのHunyuan-A13B-InstructがOpenAIおよびDeepSeekから蒸留したデータを使っている可能性が指摘されています。 話題になっているのは、モデルの出力パターンやベンチマーク結果が既存モデルと異常に似ている点。 22件の返信で意見交換されています。

  • このトピックには22件の返信、7人の参加者があり、最後に名無しさんにより2年、 10ヶ月前に更新されました。
22件の返信を表示中(うち親返信11件)
  • 投稿者
    投稿
    • #80036 返信
      名無しさん
      、TencentのHunyuan-A13B-InstructがOpenAIおよびDeepSeekから蒸留したデータを使っている可能性が指摘されています。
      話題になっているのは、モデルの出力パターンやベンチマーク結果が既存モデルと異常に似ている点。中国企業の蒸留行為はよく議論されますが、今回は特にDeepSeekとOpenAIの両方から取っていると疑われています。実際に使う際のリスクや、ローカルLLMコミュニティへの影響について考えたいと思います。

    • #80037 返信
      名無しさん
      また蒸留か…中国モデルはよくある話だけど、DeepSeekまで巻き込むとはな

      • #80039 返信
        名無しさん
        DeepSeek自体が中国製だからな…お互い様って感じか

    • #80038 返信
      名無しさん
      実際に試したけど、確かに出力が似てる気がする。でもオープンなモデルなら仕方ない部分もある

    • #80040 返信
      名無しさん
      ベンチマークで誤差範囲内のスコアって、偶然とは思えないよね

      • #80041 返信
        名無しさん
        そうそう、MMLUとかHumanEvalでほぼ同じスコア出してるらしい。さすがに疑わしい

    • #80042 返信
      名無しさん
      蒸留自体は研究目的ならいいけど、商用だとライセンス的に大丈夫なのか?

      • #80043 返信
        名無しさん
        OpenAIの利用規約違反になり得る。DeepSeekも類似の制限あるし、訴訟リスクあるんじゃない?

    • #80044 返信
      名無しさん
      でもTencentがわざわざリスク取るかな?内部で検証してると思うけど

      • #80045 返信
        名無しさん
        中国企業は意外とルーズだからな。規制が緩い国もあるし

    • #80046 返信
      名無しさん
      ローカルLLMとして使う分には別に問題ない気もする。ただモデルの透明性が欲しい

      • #80047 返信
        名無しさん
        同意。性能良いなら積極的に使いたいけど、何か問題があった時に責任取れないからな

    • #80048 返信
      名無しさん
      Hunyuanってあんまり知られてないけど、結構使えるんだよな。ただ今回の騒動で信用失うかも

      • #80049 返信
        名無しさん
        使ったことある?コーディング用途だとどう?

        • #80050 返信
          名無しさん
          試した。コード生成はDeepSeekに似てるけど、たまに変な回答が出る。やっぱり蒸留の影響かも

    • #80051 返信
      名無しさん
      こういう疑惑が出るたびに思うけど、オープンなデータセットだけでちゃんと学習するの難しいね

      • #80052 返信
        名無しさん
        でもLlamaだってMetaのデータ使ってるし、完全に独立するのは非現実的

    • #80053 返信
      名無しさん
      Redditのスレでも議論されてたけど、証拠が弱いって意見もあったよ

      • #80054 返信
        名無しさん
        確かに、ベンチマークの類似だけでは断定できない。もっと解析が必要

    • #80055 返信
      名無しさん
      個人的には、性能が良ければ蒸留でもOK派。ユーザーとしては結果が全てだし

      • #80056 返信
        名無しさん
        でもそれだとイノベーションが阻害される。やっぱりクリーンなモデルを評価すべき

    • #80057 返信
      名無しさん
      話題になってるからTencentが公式に声明出すかもしれないね

      • #80058 返信
        名無しさん
        出したところで「独立して学習しました」って否定するだけだろうけど

22件の返信を表示中(うち親返信11件)
返信先: TencentのHunyuan-A13B-Instruct、OpenAIとDeepSeekから蒸留データ使用疑惑
あなたの情報:




AA
tchmii
タイトルとURLをコピーしました