Hugging Faceは、LFM2.5ファミリーの3つのモデル(LFM2.5-1.2B-Instruct、LFM2.5-2.6B、LFM2.5-8B-A1B)向けに、DSparkドラフトモデルのチェックポイントをリリースしました。
このDSparkは、推論のデコードパスに「推測的デコーディング(speculative decoding)」の経路を追加したものであり、メモリ使用量をわずかに増加させるだけで、出力品質を変更することなく大幅なデコード速度の向上を実現しています。
この技術により、GPU上では最大3.18倍の処理スループット向上が見られ、オンデバイス環境では最大2.87倍の高速化が達成されました。
特にLFM2.5-2.6Bモデルにおいては、関数呼び出しのレイテンシが平均で57%削減されるなど、オンデバイスでのエージェント的推論への応用が期待されています。
推測的デコーディングは、LLM推論におけるレイテンシの主な原因であるDRAMからSRAMへの重みストリーミングを解決する手法です。
DSparkは、軽量なドラフトモデルを用いて候補トークンを生成し、ターゲットモデルがそれらを単一の順伝播で検証することで、重みロードのコストを検証する全トークンで共有します。
DSpark自体は、DFlashスタイルの並列バックボーン、隣接トークン間の依存関係を追加する軽量な逐次ヘッド、そして検証コストと節約額を比較して低確信度のサフィックスを刈り込む信頼度スケジューリングされた検証器の3つの要素を統合しています。
これらのドラフトモデルは、SFT、チャット、コード、関数呼び出しのデータを含む、より大規模で多様なデータセットを用いて訓練されました。
各ドラフトモデルは約3億パラメータと比較的軽量であり、その実装はllama.cppおよびSGLangで初日からサポートされています。
この統合は、LFM互換のDSpark統合がアップストリームでオープンソース化されたことを意味します。
この記事は元情報をAIで日本語に要約したものです。全文翻訳ではなく、人手による完全な検証を保証しません。詳しくは原文をご覧ください。