出来事の日付:2026年10月4日
SCMというオープンソースのmacOSアプリケーションが、写真と動画ファイル内の個々のシーンを対象としたローカル検索を提供している。このプロジェクトは、視覚埋め込みをファイル名の照合、光学文字認識、音声の文字起こしと組み合わせる。開発者によれば、メディアも推論処理もユーザーのMac内にとどまり、アカウントやクラウドへのアップロードは不要だという。
SCMは検索時にまずファイル名のキーワードを高速に照合し、その後、索引化したメディアに視覚モデルを適用する。視覚的な検索結果はテキストと画像の埋め込みの類似度で順位付けされ、弱い一致や繰り返しの多い一致を減らすための追加調整も用意されている。結果のタイルには、その項目が一致した理由が表示され、スコアの内訳も確認できる。これにより、説明のない単一の関連度順位よりも多くの判断材料をユーザーに提供する。
動画検索は、各ファイルを一つの対象として扱うのではなく、シーン単位で行う。アプリケーションはFFmpegを使ってショットの切り替わりを検出し、ユーザーが選んだ密度でフレームを抽出して、各区間の代表画像を保存する。そのため、一致した結果から動画の該当タイムコードを開くことができる。また、単一の動画から返すシーン数に上限を設け、確信度の低い結果を抑えるためのしきい値を使用する。
このアプリケーションは、画面に映る文字と発話内容について、それぞれ独立した文字どおりの一致検索経路を備える。Tesseract OCRは単語とその位置を記録し、一致した語を画像内で強調表示できるようにする。Whisperによる文字起こしは会話内のフレーズや単語の完全一致に対応し、結果を開くと該当する発話箇所に移動する。これらの経路は意味埋め込みに依存しないため、リポジトリーによると、視覚エンジンが利用できない間や起動準備中でも使用できるという。
SCMはONNX Runtimeを通じて、切り替え可能な4種類の視覚モデルに対応する。有効なモデルを変更するとライブラリーの埋め込みが再生成されるが、そのバックグラウンド処理中もファイル名検索は利用できる。OCRの言語パックは任意でダウンロードする方式で、英語は常に有効となり、追加で35言語を選択できる。標準設定には簡体字中国語、繁体字中国語、日本語、韓国語への対応が含まれる。
別途用意された任意有効化のチャット機能は、ループバックインターフェースにバインドされたローカルの`llama.cpp`プロセスを通じて動作する。OCRテキスト、会話、ファイル名など、ライブラリーからすでに抽出された根拠に基づいて質問に答え、回答にクリック可能な参照を付ける。プロジェクトの文書によると、この機能は設定で有効にするまでダウンロードも実行もされない。
現在のリポジトリーにはバージョン0.2.4のインストーラーが示されており、macOS 12以降を搭載したApple Siliconシステムを対象としている。最も簡単な導入方法としてHomebrewが案内されている。豊富な機能一覧は開発者が提示したもので、独立した評価を受けたものではないため、性能や検索品質はハードウェア、モデルの選択、ユーザーのメディアコレクションによって異なる。それでもSCMは、複数の実績あるローカルツールを組み合わせ、個人の画像・映像アーカイブ向けにプライバシーを保つ一つの検索機能を構築できることを示している。



