Hugging Faceは、自然言語処理ワークフローにおけるトークナイザーの性能を大幅に向上させた「tokenizers v1」をリリースしました。
従来、トークン化処理は機械学習パイプライン全体から見ると計算負荷が低いとされてきましたが、大規模データセットでの学習や多数の同時リクエスト処理など、ワークロードの増大に伴い、トークナイザーがデータ供給のボトルネックとなり、モデルの稼働を妨げるケースが増加しています。
このv1のリリースは、トークナイザーがワークフローの規模に合わせてスケーリングし、GPUがCPUのトークン化完了を待ってアイドル状態になる事態を防ぐことを目的としています。
発表によると、v1は従来のv0.23と比較して、場合によっては数十倍の速度向上を達成しています。
この性能向上の実現は、gigatokenやtiktokenなど、オープンソースコミュニティにおける他の高速トークナイザーライブラリの知見を取り入れた結果です。
本リリース候補版では、単一スレッド、マルチスレッド、スレッドをまたいだスケーリング、モデルごとの比較、言語ごとの比較、レイテンシ、デコードスループット、メモリヒープ、クレートサイズなど、多岐にわたるベンチマーク結果が公開されています。
v1は、出力されるトークンIDがv0.23と同一であり、API、語彙、マージランクを維持しつつ、改善可能な全ての側面を向上させています。
また、BPEに特化せず、トークナイザーファミリー全体にわたって汎用性を保ち、v0.23がロードしていた全ての機能を保持しています。
このリファクタリングにより、Hugging Faceはtokenizersライブラリが貢献価値のあるものとなることを目指しており、IBM、NVIDIA、ExecuTorchチームなどからのパッチ提供やハードウェアテスト協力に感謝が述べられています。
この記事は元情報をAIで日本語に要約したものです。全文翻訳ではなく、人手による完全な検証を保証しません。詳しくは原文をご覧ください。