DeepSeek-OCRのDocker化プレイグラウンド(FastAPI+React)— 5090対応、画像→テキスト変換

掲示板 フォーラム AI DeepSeek-OCRのDocker化プレイグラウンド(FastAPI+React)— 5090対応、画像→テキスト変換

スレッド概要

「DeepSeek-OCRのDocker化プレイグラウンド(FastAPI+React)— 5090対応、画像→テキスト変換」についてのスレッドです。FastAPIとReactで構築され、5090にも対応。 画像からテキストや説明文を生成できるツールで、今後さらに機能が追加される予定とのこと。 25件の返信で意見交換されています。

  • このトピックには25件の返信、8人の参加者があり、最後に名無しさんにより2年、 11ヶ月前に更新されました。
25件の返信を表示中(うち親返信11件)
  • 投稿者
    投稿
    • #72948 返信
      名無しさん
      Redditのr/LocalLLaMAでDeepSeek-OCRのPlaygroundがDocker化されて公開されたという投稿が話題になっています。FastAPIとReactで構築され、5090にも対応。画像からテキストや説明文を生成できるツールで、今後さらに機能が追加される予定とのこと。コメントでは、OCRの精度やローカル運用のメリット、コスト面での議論が交わされています。URL:

    • #72949 返信
      名無しさん
      これは結構便利そう。ローカルで動くOCRって需要あるし、Dockerでサクッと試せるのはいいね。

    • #72950 返信
      名無しさん
      5090って消費電力やばくない?RTX 5090で動かすのを前提にしてるけど、一般ユーザーにはまだ届かないスペックかも。

      • #72951 返信
        名無しさん
        確かに5090は高すぎる。でもDeepSeek-OCR自体は軽量だから、3090とかでも余裕で動くんじゃない?

        • #72952 返信
          名無しさん
          実際に試した人いる?精度はどう?既存のOCR(Tesseractとか)よりどれくらいマシなんだろ。

    • #72953 返信
      名無しさん
      FastAPIとReactの組み合わせはよくあるけど、ちゃんと作り込んでるっぽい。見ると結構しっかりしてる。

      • #72954 返信
        名無しさん
        UIがきれいだよね。React使ってるからカスタマイズもしやすそう。

    • #72955 返信
      名無しさん
      でもOCRって日本語の対応が課題じゃね?DeepSeekは中国語特化って話もあるし、日本語の認識はどうなんだろう。

      • #72956 返信
        名無しさん
        実際に試したけど、日本語の横書きは結構正確だったよ。縦書きはちょっとムラがあったけど。

        • #72957 返信
          名無しさん
          マルチ言語対応してるなら嬉しいな。今後のアップデートに期待。

    • #72958 返信
      名無しさん
      Redditのコメント見てると、APIキー不要でローカル完結ってところが高評価みたい。プライバシー面でも安心。

      • #72959 返信
        名無しさん
        でもDockerって初心者には敷居高くない?普通にPythonで動かせるようにしてほしかった。

        • #72960 返信
          名無しさん
          Dockerの方が環境依存なくていいと思うけどな。初心者でもdocker-compose upだけだし。

    • #72961 返信
      名無しさん
      これって商用利用できるのかな?ライセンスが不明瞭でちょっと怖い。

      • #72962 返信
        名無しさん
        DeepSeek自体はMITライセンスだったはず。ただしモデルの重みは別っぽいから確認したほうがいい。

    • #72963 返信
      名無しさん
      5090って実際どのくらいの速度出るんだろ。自分の3080で動かすの厳しいかな。

      • #72964 返信
        名無しさん
        モデルサイズ次第だけど、7BモデルならVRAM 8GBでもなんとかなるみたい。3080ならいけるんじゃない?

        • #72965 返信
          名無しさん
          実際に3080で試したけど、ちょっと遅い。でも実用レベルではある。QA用途なら我慢できる。

    • #72966 返信
      名無しさん
      画像の説明文生成機能は要らなくない?OCRだけあればいいのに。

      • #72967 返信
        名無しさん
        むしろ説明文生成がウリじゃない?OCR+キャプション生成で便利そう。

    • #72968 返信
      名無しさん
      この手のツールってすぐに開発止まるのが多いから、ちゃんとメンテされてほしい。

      • #72969 返信
        名無しさん
        GitHubのスター数見ると結構伸びてるから期待できるかも。

    • #72970 返信
      名無しさん
      個人的にはTesseract+AIの組み合わせで十分だけど、DeepSeekの品質が気になる。

      • #72971 返信
        名無しさん
        Tesseractより文書構造の認識はマシだと思う。表とかも結構取れる。

    • #72972 返信
      名無しさん
      どうせクラウドのOCR使った方が安いって意見もあったけど、ローカルならセキュリティ的にメリットあるよね。

      • #72973 返信
        名無しさん
        機密文書を扱うならローカル一択。コストより安心を取る。

25件の返信を表示中(うち親返信11件)
返信先: DeepSeek-OCRのDocker化プレイグラウンド(FastAPI+React)— 5090対応、画像→テキスト変換
あなたの情報:




AA
tchmii
タイトルとURLをコピーしました