DeepSeekのベンチマーク監査結果:HLEとGPQAで58%の誤り率、OCRミスとタイポが原因

掲示板 フォーラム AI DeepSeekのベンチマーク監査結果:HLEとGPQAで58%の誤り率、OCRミスとタイポが原因

スレッド概要

「DeepSeekのベンチマーク監査結果:HLEとGPQAで58%の誤り率、OCRミスとタイポが原因」についてのスレッドです。公開された、DeepSeekモデルのベンチマーク監査に関する話題です。 元の投稿によると、'Humanity's Last Exam' (HLE) と GPQA に対して監査を行ったところ、約58%の検証可能なエラー率が判明。 23件の返信で意見交換されています。

  • このトピックには23件の返信、7人の参加者があり、最後に名無しさんにより3年前に更新されました。
23件の返信を表示中(うち親返信12件)
  • 投稿者
    投稿
    • #71290 返信
      名無しさん
      公開された、DeepSeekモデルのベンチマーク監査に関する話題です。元の投稿によると、’Humanity’s Last Exam’ (HLE) と GPQA に対して監査を行ったところ、約58%の検証可能なエラー率が判明。その原因は、悪いOCRとタイポミスだとのこと。ベンチマークの信頼性や、ローカルLLMの評価方法について議論が起きています。

    • #71291 返信
      名無しさん
      これは結構衝撃的な結果だね。ベンチマークがこんなにいい加減だったとは。

      • #71293 返信
        名無しさん
        そうだね、ベンチマーク自体の品質が悪いとモデルの良し悪しも測れない。

    • #71292 返信
      名無しさん
      でもDeepSeekの実力ってどうなの?エラー率高いのは問題のせいってこと?

    • #71294 返信
      名無しさん
      OCRとタイポって、人間が作った問題ならまだしも、自動生成だったのかな。

      • #71295 返信
        名無しさん
        HLEは確かコミュニティが投稿した問題だから、質にばらつきがあったんだろう。

        • #71296 返信
          名無しさん
          それにしても58%は大きすぎるよ。まともなベンチマークって何があるんだ?

    • #71297 返信
      名無しさん
      ローカルLLMはそもそも評価が難しいわな。既存のベンチマークはLeakされてるし。

      • #71299 返信
        名無しさん
        そうそう、自分でタスク作ってテストするしかないかもね。めんどいけど。

    • #71298 返信
      名無しさん
      DeepSeek自体はオープンで良いと思うけど、ベンチマーク評価はちゃんとしてほしい。

    • #71300 返信
      名無しさん
      この監査、よくやったと思う。でも元のモデル開発者が修正すべき案件だな。

      • #71301 返信
        名無しさん
        いや、監査した人がDeepSeekの改良版を使ってるって話でしょ?自己申告だしなあ。

        • #71302 返信
          名無しさん
          それでも問題の指摘自体は有用。他のモデルでも同じ問題起きてるかも。

    • #71303 返信
      名無しさん
      ベンチマークを信じすぎるのは危険ってことだな。実用重視で行こう。

    • #71304 返信
      名無しさん
      日本語のベンチマークも似たような問題あるんじゃない?

      • #71305 返信
        名無しさん
        ありそう。特にOCR起因のエラーは言語問わず発生する。

    • #71306 返信
      名無しさん
      DeepSeek使ってみたけど、確かにコード生成は優秀。でもベンチマークの数字だけで判断できないね。

      • #71307 返信
        名無しさん
        そうそう、実際に動かして実感するのが一番。ベンチは参考程度に。

    • #71308 返信
      名無しさん
      HLEってHumanity’s Last Examっていう割には残念な中身だな。

      • #71309 返信
        名無しさん
        名前負けしてる。もっと厳密に作るべきだった。

    • #71310 返信
      名無しさん
      この監査結果、論文になるのかな?面白い研究だと思う。

      • #71311 返信
        名無しさん
        なるといいね。ベンチマークの質を上げるきっかけになるかも。

    • #71312 返信
      名無しさん
      個人的には、こういう検証はもっと増えてほしい。業界全体のためになる。

      • #71313 返信
        名無しさん
        賛成。透明性が大事。モデルだけじゃなく、評価方法もオープンにしよう。

23件の返信を表示中(うち親返信12件)
返信先: DeepSeekのベンチマーク監査結果:HLEとGPQAで58%の誤り率、OCRミスとタイポが原因で#71310に返信
あなたの情報:




AA
tchmii
タイトルとURLをコピーしました