Hugging Faceは、新しい多言語マルチモーダルエンコーダ「NeoMME」(ニーオミ)を発表しました。
NeoMMEは、既存の生成型ビジュアル言語モデルとは異なり、別途事前学習されたビジョンタワーや因果言語モデルを使用しません。
代わりに、単一の双方向Transformerがテキストトークンと生の画像パッチの両方を処理します。
このモデル全体は、マスクされた離散拡散目的関数を用いてゼロから訓練されています。
NeoMMEは、2億6000万パラメータと8億パラメータの2つのサイズで提供されています。
このモデルは、画像とテキストが同じ計算経路を共有しているため、両方のモダリティにわたる事前学習、ファインチューニング、並列化、およびサービングが容易になります。
特に、ビジュアルドキュメント検索へのファインチューニングでは、ColPaliのページ画像アプローチが利用されました。
NeoMME-Retrieverは、単一の順伝播パスで密な埋め込みと遅延相互作用埋め込みを返します。
性能面では、260MモデルはNVIDIA L40S GPU上で2048×2048の画像入力サイズにおいて、約51ページ/秒のエンコード速度を達成し、これはColModernVBERTの処理速度の約2倍に相当します。
また、階層的トークンプーリングと非対称量子化を適用することで、ページあたりの遅延相互作用インデックスストレージを約1.5MBからわずか6kBに削減しつつ、ベースラインのnDCG@10の95%以上を維持しています。
NeoMMEはHugging Face Transformersで利用可能であり、すべてのモデルチェックポイントはApache 2.0ライセンスの下で公開されています。
このアプローチは、従来のビジョン言語モデルが持つ、因果デコーダやパラメータ・計算オーバーヘッドを回避しつつ、高性能なマルチモーダル処理を実現することを目的としています。
この記事は元情報をAIで日本語に要約したものです。全文翻訳ではなく、人手による完全な検証を保証しません。詳しくは原文をご覧ください。
Hugging Face
NeoMME: an efficient Multimodal-native and Multilingual Encoder
原文の記事を確認する ↗