DeepSeek-OCRをvLLM+Open WebUIで動かしてみたテスト

掲示板 フォーラム AI DeepSeek-OCRをvLLM+Open WebUIで動かしてみたテスト

スレッド概要

「DeepSeek-OCRをvLLM+Open WebUIで動かしてみたテスト」についてのスレッドです。このモデルはOCRタスクに特化したDeepSeekの派生で、ローカルで動かせるのが魅力。 コメントでは精度や速度、他のOCRモデルとの比較、コスト面の話が出ていました。 22件の返信で意見交換されています。

  • このトピックには22件の返信、7人の参加者があり、最後に名無しさんにより2年、 11ヶ月前に更新されました。
22件の返信を表示中(うち親返信8件)
  • 投稿者
    投稿
    • #74666 返信
      名無しさん
      Redditのr/LocalLLaMAでDeepSeek-OCRをvLLM 0.11.1rc6.dev7とOpen WebUIでテストした投稿がありました。このモデルはOCRタスクに特化したDeepSeekの派生で、ローカルで動かせるのが魅力。コメントでは精度や速度、他のOCRモデルとの比較、コスト面の話が出ていました。

    • #74667 返信
      名無しさん
      お、これ試してみたい。DeepSeekって結構使えるんだよな。

      • #74669 返信
        名無しさん
        試したけど結構速いよ。ただメモリ使用量が大きいからVRAM多くないと厳しいかも。

    • #74668 返信
      名無しさん
      vLLMのバージョンがrcってまだベータなのかな。安定版だと動かないとかある?

    • #74670 返信
      名無しさん
      OCRに特化ってどういうこと?普通のLLMじゃだめなの?

      • #74671 返信
        名無しさん
        画像の文字認識ってやっぱり専用モデルの方が正確だよ。DeepSeek-OCRはそのへんチューニングされてるらしい。

        • #74672 返信
          名無しさん
          でもTesseractみたいな従来のOCRと比べてどうなんだろう。コスパ考えたらTesseractで十分な気もする。

          • #74673 返信
            名無しさん
            Tesseractは日本語の複雑なレイアウトだと精度落ちるから、その点ではDeepSeekの方が強いかも。試す価値あり。

    • #74674 返信
      名無しさん
      Open WebUIで使えるのは便利だね。でもAPI経由の方が楽じゃない?

      • #74675 返信
        名無しさん
        ローカルで動かせるのがメリットだよ。データを外に出したくないケースには最適。

        • #74676 返信
          名無しさん
          確かにプライバシー面では安心。でも自前でGPU用意するコスト考えたらAPIでもいいかもね。

          • #74677 返信
            名無しさん
            クラウドのAPIは従量課金で意外と高くつくから、頻繁に使うならローカルのほうが安上がりだよ。

    • #74678 返信
      名無しさん
      このモデルってどれくらいのGPU必要?RTX3090で動く?

      • #74679 返信
        名無しさん
        3090の24GBなら余裕で動くと思う。少なくとも16GB以上は欲しい。

        • #74680 返信
          名無しさん
          今のところ8GBのカードしかないから厳しいな…量子化モデルとか出ないかな。

          • #74681 返信
            名無しさん
            DeepSeek自体に量子化版があるから、そのうちOCRも出るんじゃない?期待して待ってる。

    • #74682 返信
      名無しさん
      これって手書き文字も認識できるの?論文読んだ感じだと活字メインっぽいけど。

      • #74683 返信
        名無しさん
        試した限りでは印刷された文字はかなり正確。手書きはちょっと苦手みたい。

        • #74684 返信
          名無しさん
          やっぱり手書きは別のモデルか、再学習が必要かもね。

    • #74685 返信
      名無しさん
      vLLMのバグでたまに落ちるってRedditで見たんだけど、大丈夫?

      • #74686 返信
        名無しさん
        自分はベータ版だけど安定して動いてるよ。環境次第かな。

        • #74687 返信
          名無しさん
          なるべく最新版にアップデートしたほうが安全そう。

    • #74688 返信
      名無しさん
      まとめると、ローカルで動くOCRモデルとして選択肢が増えたのはいいね。精度はまあまあ、コストは要検討ってところか。

22件の返信を表示中(うち親返信8件)
返信先: DeepSeek-OCRをvLLM+Open WebUIで動かしてみたテスト
あなたの情報:




AA
tchmii
タイトルとURLをコピーしました