スレッド概要
「DeepSeekのベンチマーク監査結果:HLEとGPQAで58%の誤り率、OCRミスとタイポが原因」についてのスレッドです。公開された、DeepSeekモデルのベンチマーク監査に関する話題です。 元の投稿によると、'Humanity's Last Exam' (HLE) と GPQA に対して監査を行ったところ、約58%の検証可能なエラー率が判明。 23件の返信で意見交換されています。
- このトピックには23件の返信、7人の参加者があり、最後に名無しさんにより3年前に更新されました。
23件の返信を表示中(うち親返信12件)
-
投稿者投稿
-
-
名無しさん公開された、DeepSeekモデルのベンチマーク監査に関する話題です。元の投稿によると、’Humanity’s Last Exam’ (HLE) と GPQA に対して監査を行ったところ、約58%の検証可能なエラー率が判明。その原因は、悪いOCRとタイポミスだとのこと。ベンチマークの信頼性や、ローカルLLMの評価方法について議論が起きています。
-
名無しさんこれは結構衝撃的な結果だね。ベンチマークがこんなにいい加減だったとは。
-
名無しさんそうだね、ベンチマーク自体の品質が悪いとモデルの良し悪しも測れない。
-
-
名無しさんでもDeepSeekの実力ってどうなの?エラー率高いのは問題のせいってこと?
-
名無しさんOCRとタイポって、人間が作った問題ならまだしも、自動生成だったのかな。
-
名無しさんHLEは確かコミュニティが投稿した問題だから、質にばらつきがあったんだろう。
-
名無しさんそれにしても58%は大きすぎるよ。まともなベンチマークって何があるんだ?
-
-
-
名無しさんローカルLLMはそもそも評価が難しいわな。既存のベンチマークはLeakされてるし。
-
名無しさんそうそう、自分でタスク作ってテストするしかないかもね。めんどいけど。
-
-
名無しさんDeepSeek自体はオープンで良いと思うけど、ベンチマーク評価はちゃんとしてほしい。
-
名無しさんこの監査、よくやったと思う。でも元のモデル開発者が修正すべき案件だな。
-
名無しさんいや、監査した人がDeepSeekの改良版を使ってるって話でしょ?自己申告だしなあ。
-
名無しさんそれでも問題の指摘自体は有用。他のモデルでも同じ問題起きてるかも。
-
-
-
名無しさんベンチマークを信じすぎるのは危険ってことだな。実用重視で行こう。
-
名無しさん日本語のベンチマークも似たような問題あるんじゃない?
-
名無しさんありそう。特にOCR起因のエラーは言語問わず発生する。
-
-
名無しさんDeepSeek使ってみたけど、確かにコード生成は優秀。でもベンチマークの数字だけで判断できないね。
-
名無しさんそうそう、実際に動かして実感するのが一番。ベンチは参考程度に。
-
-
名無しさんHLEってHumanity’s Last Examっていう割には残念な中身だな。
-
名無しさん名前負けしてる。もっと厳密に作るべきだった。
-
-
名無しさんこの監査結果、論文になるのかな?面白い研究だと思う。
-
名無しさんなるといいね。ベンチマークの質を上げるきっかけになるかも。
-
-
名無しさん個人的には、こういう検証はもっと増えてほしい。業界全体のためになる。
-
名無しさん賛成。透明性が大事。モデルだけじゃなく、評価方法もオープンにしよう。
-
-
-
投稿者投稿
23件の返信を表示中(うち親返信12件)
関連するAIトピック
- DeepSeek V3でコード監査エージェント作ったってのスレ。AST解析+ハイブリッド検索でシニア級らしい。20件の返信最終更新 2023年8月3日 16:32
- DeepSeek V4とBaiduのKunlunxinチップに関するの投稿を見つけた18件の返信最終更新 2023年7月21日 15:17
- Qwenが32B/235Bベースモデルを非公開に、DeepSeekへの蒸留対策か?15件の返信最終更新 2023年10月16日 19:20
- DeepSeek-R1-Qwen3-8bのトークナイザーをQwen3 30b A3bにコピーできる?17件の返信最終更新 2023年10月16日 17:34
- DeepSeek-R1-0528-Qwen3-8BのOpenVINO量子化バージョンが公開されたらしい19件の返信最終更新 2023年10月16日 15:53