出来事の日付:2026年6月23日。

百度が公開しているGitHubリポジトリで、開発者らがワンショットの長文脈光学文字認識を支援する取り組みと説明する文書解析プロジェクト「Unlimited-OCR」が公開された。このリポジトリは一般消費者向けアプリケーションではなく、デプロイと推論の手順を提供しており、画像やPDF文書を扱う開発者向けのワークフローを対象としている。

公開されているセットアップ手順は、Hugging Face TransformersとNvidia製GPUを使用した推論を中心としている。メンテナーによると、記載された要件はPython 3.12.3とCUDA 12.9でテストされた。この但し書きは利用を検討する人にとって重要だ。テスト済み環境を示す一方、それ以外のあらゆるハードウェアやソフトウェアの組み合わせでも同様に動作することを保証するものではないためだ。

Unlimited-OCRのドキュメントは、別のデプロイ方法として公式のvLLMレシピも案内している。ユーザーにはGPUプラットフォームに応じてDockerイメージを選択するよう指示しており、アクセラレーター環境による違いをプロジェクトが想定していることが分かる。このリポジトリはインストールを単一の汎用構成に集約せず、開発者が自らのインフラに合わせられる複数の方法を提示している。

さらに、SGLangを使用する選択肢もある。このセットアップでは、ローカルで用意したSGLangのwheel、バージョンを固定したkernelsパッケージ、PDFページを画像に変換するためのPyMuPDFが必要だと手順に記されている。続いてリポジトリは、サーバーを起動し、OpenAI互換APIにリクエストを送信する方法を説明している。文書化されたリクエストフローではストリーミング応答もサポートされ、生成された出力を順次受信できる。

個別画像と長い文書との違いは、各サンプルを通じて示されている。あるワークフローでは文書解析のために画像を送信し、別のワークフローでは複数ページを処理する。PDFの場合、まず各ページを画像ファイルに変換し、その後、複数ページ用の処理に渡す。この構成により、PDF処理を説明のない組み込み手順として扱うのではなく、画像変換の段階が開発者に明示されている。

より大規模な処理については、同梱されたバッチ推論の手引きによると、`infer.py`スクリプトでSGLangサーバーを自動起動し、画像ディレクトリまたはPDFに対して並行リクエストを送信できる。これにより、個別のテストから入力群の処理へ移行する手段が提供される一方、デプロイ方法とリソースの選択は運用者に委ねられる。リポジトリはさらに、OmniDocBenchでの評価を目的とする出力には後処理が必要だと記している。

プロジェクト資料では、この取り組みに影響を与えたモデルやアイデアについて、Deepseek-OCR、Deepseek-OCR-2、PaddleOCRに謝意を表している。この謝辞は、Unlimited-OCRを孤立したシステムとしてではなく、既存のOCRおよび文書解析開発の系譜に位置付けるものだ。

リポジトリの資料は、モデルの実行方法と一般的な推論フレームワークへの接続方法に重点を置いている。提示された証拠には、精度、速度、コスト面での優位性を独立に立証できるだけの情報は含まれていない。したがって、このリリースは、文書化された複数の推論方法を備えた開発者向けのモデルおよび実装パッケージと捉えるのが最も適切だ。比較性能に関する主張には、提供されたデプロイ手順を超える追加評価が必要となる。