スレッド概要
「DeepSeek-OCRをvLLM+Open WebUIで動かしてみたテスト」についてのスレッドです。このモデルはOCRタスクに特化したDeepSeekの派生で、ローカルで動かせるのが魅力。 コメントでは精度や速度、他のOCRモデルとの比較、コスト面の話が出ていました。 22件の返信で意見交換されています。
- このトピックには22件の返信、7人の参加者があり、最後に名無しさんにより2年、 11ヶ月前に更新されました。
22件の返信を表示中(うち親返信8件)
-
投稿者投稿
-
-
名無しさんRedditのr/LocalLLaMAでDeepSeek-OCRをvLLM 0.11.1rc6.dev7とOpen WebUIでテストした投稿がありました。このモデルはOCRタスクに特化したDeepSeekの派生で、ローカルで動かせるのが魅力。コメントでは精度や速度、他のOCRモデルとの比較、コスト面の話が出ていました。
-
名無しさんお、これ試してみたい。DeepSeekって結構使えるんだよな。
-
名無しさん試したけど結構速いよ。ただメモリ使用量が大きいからVRAM多くないと厳しいかも。
-
-
名無しさんvLLMのバージョンがrcってまだベータなのかな。安定版だと動かないとかある?
-
名無しさんOCRに特化ってどういうこと?普通のLLMじゃだめなの?
-
名無しさん画像の文字認識ってやっぱり専用モデルの方が正確だよ。DeepSeek-OCRはそのへんチューニングされてるらしい。
-
名無しさんでもTesseractみたいな従来のOCRと比べてどうなんだろう。コスパ考えたらTesseractで十分な気もする。
-
名無しさんTesseractは日本語の複雑なレイアウトだと精度落ちるから、その点ではDeepSeekの方が強いかも。試す価値あり。
-
-
-
-
名無しさんOpen WebUIで使えるのは便利だね。でもAPI経由の方が楽じゃない?
-
名無しさんローカルで動かせるのがメリットだよ。データを外に出したくないケースには最適。
-
名無しさん確かにプライバシー面では安心。でも自前でGPU用意するコスト考えたらAPIでもいいかもね。
-
名無しさんクラウドのAPIは従量課金で意外と高くつくから、頻繁に使うならローカルのほうが安上がりだよ。
-
-
-
-
名無しさんこのモデルってどれくらいのGPU必要?RTX3090で動く?
-
名無しさん3090の24GBなら余裕で動くと思う。少なくとも16GB以上は欲しい。
-
名無しさん今のところ8GBのカードしかないから厳しいな…量子化モデルとか出ないかな。
-
名無しさんDeepSeek自体に量子化版があるから、そのうちOCRも出るんじゃない?期待して待ってる。
-
-
-
-
名無しさんこれって手書き文字も認識できるの?論文読んだ感じだと活字メインっぽいけど。
-
名無しさん試した限りでは印刷された文字はかなり正確。手書きはちょっと苦手みたい。
-
名無しさんやっぱり手書きは別のモデルか、再学習が必要かもね。
-
-
-
名無しさんvLLMのバグでたまに落ちるってRedditで見たんだけど、大丈夫?
-
名無しさん自分はベータ版だけど安定して動いてるよ。環境次第かな。
-
名無しさんなるべく最新版にアップデートしたほうが安全そう。
-
-
-
名無しさんまとめると、ローカルで動くOCRモデルとして選択肢が増えたのはいいね。精度はまあまあ、コストは要検討ってところか。
-
-
投稿者投稿
22件の返信を表示中(うち親返信8件)
関連するAIトピック
- DeepSeek V3でコード監査エージェント作ったってのスレ。AST解析+ハイブリッド検索でシニア級らしい。20件の返信最終更新 2023年8月3日 16:32
- DeepSeek V4とBaiduのKunlunxinチップに関するの投稿を見つけた18件の返信最終更新 2023年7月21日 15:17
- Qwenが32B/235Bベースモデルを非公開に、DeepSeekへの蒸留対策か?15件の返信最終更新 2023年10月16日 19:20
- DeepSeek-R1-Qwen3-8bのトークナイザーをQwen3 30b A3bにコピーできる?17件の返信最終更新 2023年10月16日 17:34
- DeepSeek-R1-0528-Qwen3-8BのOpenVINO量子化バージョンが公開されたらしい19件の返信最終更新 2023年10月16日 15:53