Deepseek-OCRってOCRタスクでSOTAなの?

掲示板 フォーラム AI Deepseek-OCRってOCRタスクでSOTAなの?

スレッド概要

「Deepseek-OCRってOCRタスクでSOTAなの?」についてのスレッドです。DeepSeek社が公開したOCRモデルで、ベンチマークで既存手法を上回ったという主張があるようです。 ただし、実際に試した人の間では、日本語や特殊フォントの精度に疑問もあるみたい。 24件の返信で意見交換されています。

  • このトピックには24件の返信、8人の参加者があり、最後に名無しさんにより2年、 11ヶ月前に更新されました。
24件の返信を表示中(うち親返信11件)
  • 投稿者
    投稿
    • #74589 返信
      名無しさん
      Redditのr/LocalLLaMAで「Deepseek-OCRはOCRタスクでSOTAか?」というスレッドが立っていました。DeepSeek社が公開したOCRモデルで、ベンチマークで既存手法を上回ったという主張があるようです。ただし、実際に試した人の間では、日本語や特殊フォントの精度に疑問もあるみたい。ローカルLLMとして手軽に使えるのか、コストやプライバシーの観点からも議論になっています。ッド: 皆さんはどう思いますか?

    • #74590 返信
      名無しさん
      ベンチマーク見た感じ確かに数字はいいけど、実用だとどうなんかな。

      • #74591 返信
        名無しさん
        自分は画像の前処理次第って思う。しっかり二値化とかしてから食わせると結構いける。

    • #74592 返信
      名無しさん
      Deepseekってコスパいいん?ローカルで動かすならVLM系より軽量なのかな。

      • #74593 返信
        名無しさん
        GPT-4oとかよりは安いけど、Tesseractと比べると遅いし重い。GPU必須。

    • #74594 返信
      名無しさん
      日本語の認識はどれくらい正確?見たけど英語ベンチばかりで不安。

      • #74595 返信
        名無しさん
        試したけど、縦書きはだめだね。横書きならそこそこ。中国語には強いらしい。

        • #74596 返信
          名無しさん
          やっぱり訓練データに日本語が少ないんだろうな。もっと公開データ増えないと。

    • #74597 返信
      名無しさん
      プライバシー気にするならローカルで動くのはいい。でもAPI使う方が楽なんだよな。

      • #74598 返信
        名無しさん
        外部送信嫌なら自前でやるしかないね。でもメンテコスト考えるとクラウドの方が安いかも。

    • #74599 返信
      名無しさん
      SOTAって言うほど他の手法と差ある?EasyOCRでも十分な場面多いし。

      • #74600 返信
        名無しさん
        あくまでベンチマーク上の話で、実データだと誤差範囲みたいな気もする。

    • #74601 返信
      名無しさん
      自分は業務で使ってるけど、帳票OCRとしてはまだ使いにくい。レイアウト認識が弱い。

      • #74602 返信
        名無しさん
        それならPaddleOCRの方が優秀じゃない?日本語モデルもあるし。

        • #74603 返信
          名無しさん
          PaddleOCRは確かに日本語強い。でもDeepseekの方が汎用性高いかも。

    • #74604 返信
      名無しさん
      OSSでありがたいけど、商用利用のライセンスはどうなってる?調べた?

      • #74605 返信
        名無しさん
        Apache 2.0っぽいけど、DeepSeekの独自条項あるって噂。あとで確認する。

    • #74606 返信
      名無しさん
      GPT-4oとかClaudeのOCRに比べてどうなんだろう。自分はAPI派だけど。

      • #74607 返信
        名無しさん
        単純なテキスト抽出ならDeepseekでも十分だけど、高精度が必要ならやっぱり大手APIの方が信頼できる。

    • #74608 返信
      名無しさん
      LLMベースのOCRって、従来のモデルと比べて何が違うの?

      • #74609 返信
        名無しさん
        文脈を考慮して誤認識を補正できるってのが強み。でもその分遅い。

    • #74610 返信
      名無しさん
      結局用途次第だな。定型フォームなら従来手法、非構造化文書ならLLM系って感じ。

      • #74611 返信
        名無しさん
        そうそう。ベストなモデル一つに絞るより、使い分けが現実的。

    • #74612 返信
      名無しさん
      DeepSeekは色々出してるけど、このOCRモデルは実験段階っぽいね。今後に期待。

      • #74613 返信
        名無しさん
        オープンなのはいいけど、バグが多いってレビューも見た。安定性が課題。

24件の返信を表示中(うち親返信11件)
返信先: Deepseek-OCRってOCRタスクでSOTAなの?
あなたの情報:




AA
tchmii
タイトルとURLをコピーしました