近年、ツールを使用する大規模言語モデル(LLM)エージェントは、単一の文書から情報を読み取るのではなく、検索ツール、構造化された記録、データベースの照会など、複数の情報源(Model Context Protocol: MCP)から情報を統合して回答を生成しています。この複雑な情報統合によ
Hugging Faceは、汎用的なコンピューター操作エージェントを目的とした新しいモデルシリーズ「Holo4」を発表しました。Holo4は、27Bの密なモデルと35B-A3BのMixture of Experts(MoE)モデルの2つのサイズで提供され、H Models APIを通じて利
Hugging Face Hubが、強化学習(RL)環境をホストするための専用機能を追加しました。この機能により、エージェント型AIシステムの性能測定と改善が容易になります。RL環境は、エージェントにタスクを与え、その行動に対して観測を返し、結果を評価するための報酬を付与する仕組みを提供し
英国AIセキュリティ研究所(AISI)は、EvalEvalのインフラストラクチャを活用し、AIモデルの評価結果をオープンに共有することで、より再現性が高く検証可能な評価科学の推進を支援しています。AIの導入が加速する中で、モデルやシステムの性能に関する評価は重要な証拠源となっていますが、結
Hugging Faceは、TransformersライブラリにGGUFモデルを効率的に実行するサポートを追加しました。これにより、ユーザーはノートパソコンのメモリサイズに適合したチェックポイントを利用しつつ、慣れ親しんだTransformers APIを通じてAIモデルをローカルで実行で
Hugging Faceは、oMLXの作成者兼メンテナーであるJun Kim氏を新たなチームメンバーとして迎え入れることを発表しました。同社はローカルAIに深く関与しており、Apple Siliconに最適化されたAppleのフレームワークであるMLXをエコシステムの中核として位置づけてい
Hugging Faceは、自然言語処理ワークフローにおけるトークナイザーの性能を大幅に向上させた「tokenizers v1」をリリースしました。従来、トークン化処理は機械学習パイプライン全体から見ると計算負荷が低いとされてきましたが、大規模データセットでの学習や多数の同時リクエスト処理
AIエージェントの性能評価において、多くのベンチマークは単一の平均的な成功率(Mean@k)を報告しますが、これは実運用における「再現性」という重要な課題を覆い隠しています。例えば、GPT-4.1を用いたReActエージェントがAppWorldテストで平均77.4%の成功率を示しても、5回
Hugging Faceは、TRLのAsyncGRPOTrainerにLoRAアダプターのサポートを導入し、TRL v1.14で提供を開始しました。この機能により、トレーナーがモデル全体ではなく、数メガバイト程度の軽量なLoRAアダプターのみを学習し、それをvLLMに同期することが可能にな
Hugging Faceは、以前の投稿で示唆された複雑なシステムであるAUTOMATIC1111のstable-diffusion-webuiの機能を、Gradio Workflowを用いて再構築した「Workflow1111」を発表しました。このWorkflow1111は、73のノードか
Hugging Faceは、新しい多言語マルチモーダルエンコーダ「NeoMME」(ニーオミ)を発表しました。NeoMMEは、既存の生成型ビジュアル言語モデルとは異なり、別途事前学習されたビジョンタワーや因果言語モデルを使用しません。代わりに、単一の双方向Transformerがテキストトー
本ガイドは、比較的小規模な大規模言語モデル(LLM)を、特定のタスクである「構造化出力の遵守(schema compliance)」において大幅に改善するための、公開され低コストな手法を提示しています。具体的には、LFM2.5-350Mというモデルに対し、Group Relative Po
開発者が複数のマシンやタスクに応じて利用するコーディングエージェントは、セッションが終了すると過去の推論過程や決定理由といった重要な情報を失いがちです。これまでのエージェントの実行ログは、何が変更されたかだけでなく「なぜ変更されたのか」という詳細な記録を残していますが、これらは単なるアーカ
言語モデルがコードを生成し、それによって水彩画を描くという、芸術と工学の融合したプロジェクトが公開されました。このアイデアは、Surya Narreddi氏によるもので、当初はクローズアップの花など、限定的な段階で発表されていましたが、本記事ではその手法をTRL(Transformer R
本稿では、大規模言語モデル(LLM)のベンチマーク評価を、個々のプロンプト(質問やタスク)レベルで監査するための新しい手法「BenchMIRT」が導入されたことを報告しています。従来のベンチマークは、安全性や一般的な推論といった特定の能力を測定するように設計されていますが、個々のタスクが必
Hugging Faceは、ブラウザ上でのAI推論を可能な限り高速かつ使いやすくすることを目指す取り組みの一環として、新しいライブラリ「@huggingface/kernels」をリリースしました。このライブラリは、Hugging Face Hubから最適化されたWebGPUカーネルをロー
Hugging FaceとVoice Arenaは提携し、オープンな自動音声認識(ASR)評価の枠組みを拡充しました。この度、南アジアの言語を対象とした評価セットが導入され、特にヒンディー語とインド英語のベンチマークが追加されました。これまでのリーダーボードは、主にヨーロッパ言語を対象とし
PythonライブラリであるSentence Transformersは、検索拡張生成(RAG)や意味的検索など、多様なアプリケーションで埋め込みおよびリランカーモデルを利用・訓練するためのツールです。このライブラリのv6.0アップデートにより、ColBERTスタイルの遅延相互作用検索に対