スレッド概要
「Deepseek-OCRってOCRタスクでSOTAなの?」についてのスレッドです。DeepSeek社が公開したOCRモデルで、ベンチマークで既存手法を上回ったという主張があるようです。 ただし、実際に試した人の間では、日本語や特殊フォントの精度に疑問もあるみたい。 24件の返信で意見交換されています。
- このトピックには24件の返信、8人の参加者があり、最後に名無しさんにより2年、 11ヶ月前に更新されました。
24件の返信を表示中(うち親返信11件)
-
投稿者投稿
-
-
名無しさんRedditのr/LocalLLaMAで「Deepseek-OCRはOCRタスクでSOTAか?」というスレッドが立っていました。DeepSeek社が公開したOCRモデルで、ベンチマークで既存手法を上回ったという主張があるようです。ただし、実際に試した人の間では、日本語や特殊フォントの精度に疑問もあるみたい。ローカルLLMとして手軽に使えるのか、コストやプライバシーの観点からも議論になっています。ッド: 皆さんはどう思いますか?
-
名無しさんベンチマーク見た感じ確かに数字はいいけど、実用だとどうなんかな。
-
名無しさん自分は画像の前処理次第って思う。しっかり二値化とかしてから食わせると結構いける。
-
-
名無しさんDeepseekってコスパいいん?ローカルで動かすならVLM系より軽量なのかな。
-
名無しさんGPT-4oとかよりは安いけど、Tesseractと比べると遅いし重い。GPU必須。
-
-
名無しさん日本語の認識はどれくらい正確?見たけど英語ベンチばかりで不安。
-
名無しさん試したけど、縦書きはだめだね。横書きならそこそこ。中国語には強いらしい。
-
名無しさんやっぱり訓練データに日本語が少ないんだろうな。もっと公開データ増えないと。
-
-
-
名無しさんプライバシー気にするならローカルで動くのはいい。でもAPI使う方が楽なんだよな。
-
名無しさん外部送信嫌なら自前でやるしかないね。でもメンテコスト考えるとクラウドの方が安いかも。
-
-
名無しさんSOTAって言うほど他の手法と差ある?EasyOCRでも十分な場面多いし。
-
名無しさんあくまでベンチマーク上の話で、実データだと誤差範囲みたいな気もする。
-
-
名無しさん自分は業務で使ってるけど、帳票OCRとしてはまだ使いにくい。レイアウト認識が弱い。
-
名無しさんそれならPaddleOCRの方が優秀じゃない?日本語モデルもあるし。
-
名無しさんPaddleOCRは確かに日本語強い。でもDeepseekの方が汎用性高いかも。
-
-
-
名無しさんOSSでありがたいけど、商用利用のライセンスはどうなってる?調べた?
-
名無しさんApache 2.0っぽいけど、DeepSeekの独自条項あるって噂。あとで確認する。
-
-
名無しさんGPT-4oとかClaudeのOCRに比べてどうなんだろう。自分はAPI派だけど。
-
名無しさん単純なテキスト抽出ならDeepseekでも十分だけど、高精度が必要ならやっぱり大手APIの方が信頼できる。
-
-
名無しさんLLMベースのOCRって、従来のモデルと比べて何が違うの?
-
名無しさん文脈を考慮して誤認識を補正できるってのが強み。でもその分遅い。
-
-
名無しさん結局用途次第だな。定型フォームなら従来手法、非構造化文書ならLLM系って感じ。
-
名無しさんそうそう。ベストなモデル一つに絞るより、使い分けが現実的。
-
-
名無しさんDeepSeekは色々出してるけど、このOCRモデルは実験段階っぽいね。今後に期待。
-
名無しさんオープンなのはいいけど、バグが多いってレビューも見た。安定性が課題。
-
-
-
投稿者投稿
24件の返信を表示中(うち親返信11件)
関連するAIトピック
- DeepSeek V3でコード監査エージェント作ったってのスレ。AST解析+ハイブリッド検索でシニア級らしい。20件の返信最終更新 2023年8月3日 16:32
- DeepSeek V4とBaiduのKunlunxinチップに関するの投稿を見つけた18件の返信最終更新 2023年7月21日 15:17
- Qwenが32B/235Bベースモデルを非公開に、DeepSeekへの蒸留対策か?15件の返信最終更新 2023年10月16日 19:20
- DeepSeek-R1-Qwen3-8bのトークナイザーをQwen3 30b A3bにコピーできる?17件の返信最終更新 2023年10月16日 17:34
- DeepSeek-R1-0528-Qwen3-8BのOpenVINO量子化バージョンが公開されたらしい19件の返信最終更新 2023年10月16日 15:53