Hugging Faceは、TransformersライブラリにGGUFモデルを効率的に実行するサポートを追加しました。
これにより、ユーザーはノートパソコンのメモリサイズに適合したチェックポイントを利用しつつ、慣れ親しんだTransformers APIを通じてAIモデルをローカルで実行できるようになります。
GGUFは、llama.cppチームによって開発された、ローカル推論で広く利用されているフォーマットです。
この機能追加により、OllamaやLM StudioといったローカルAIツールが利用するllama.cppの推論エンジンを活用し、MLXなどのプロジェクトと共に、日常的な利用におけるローカル推論をより実用的な選択肢にしています。
GGUFモデルは、モデルの重みやトークナイザー情報などのメタデータを単一のファイルにパッケージ化しており、Q4_K_Mのような様々な量子化レベルをサポートしています。
量子化により、精度のわずかなトレードオフと引き換えに、メモリフットプリントを小さくすることが可能です。
パフォーマンスをllama.cppに近づけるため、Hugging Faceはその基盤となるggmlカーネルをkernelsライブラリを通じて再利用し、generate処理におけるオーバーヘッドを削減しました。
初期の焦点はApple Silicon上でのローカル推論であり、Qwen3.5アーキテクチャから開始されています。
ユーザーはHubからGGUFを選択し、`from_pretrained`でロードすることで、自身のマシン上で推論を開始できます。
GGUFモデルの量子化タイプについては、Hubのドキュメントで利用可能な種類が説明されています。
一般的に、Q4_K_Mから試すことが推奨されており、より多くのメモリがあればQ5_K_MやQ6_Kを試すことが提案されています。
この機能は、AIモデルをローカル環境で実行する際の障壁を大きく下げ、より多くのユーザーが高性能なAI機能にアクセスしやすくすることを目的としています。
この記事は元情報をAIで日本語に要約したものです。全文翻訳ではなく、人手による完全な検証を保証しません。詳しくは原文をご覧ください。