Hugging Faceは、以前の投稿で示唆された複雑なシステムであるAUTOMATIC1111のstable-diffusion-webuiの機能を、Gradio Workflowを用いて再構築した「Workflow1111」を発表しました。このWorkflow1111は、73のノードか
Hugging Faceは、新しい多言語マルチモーダルエンコーダ「NeoMME」(ニーオミ)を発表しました。NeoMMEは、既存の生成型ビジュアル言語モデルとは異なり、別途事前学習されたビジョンタワーや因果言語モデルを使用しません。代わりに、単一の双方向Transformerがテキストトー
開発者が複数のマシンやタスクに応じて利用するコーディングエージェントは、セッションが終了すると過去の推論過程や決定理由といった重要な情報を失いがちです。これまでのエージェントの実行ログは、何が変更されたかだけでなく「なぜ変更されたのか」という詳細な記録を残していますが、これらは単なるアーカ
Hugging Faceは、ブラウザ上でのAI推論を可能な限り高速かつ使いやすくすることを目指す取り組みの一環として、新しいライブラリ「@huggingface/kernels」をリリースしました。このライブラリは、Hugging Face Hubから最適化されたWebGPUカーネルをロー
Hugging FaceとVoice Arenaは提携し、オープンな自動音声認識(ASR)評価の枠組みを拡充しました。この度、南アジアの言語を対象とした評価セットが導入され、特にヒンディー語とインド英語のベンチマークが追加されました。これまでのリーダーボードは、主にヨーロッパ言語を対象とし
PythonライブラリであるSentence Transformersは、検索拡張生成(RAG)や意味的検索など、多様なアプリケーションで埋め込みおよびリランカーモデルを利用・訓練するためのツールです。このライブラリのv6.0アップデートにより、ColBERTスタイルの遅延相互作用検索に対
大規模言語モデル(LLM)を実用的に展開する際、モデルのサイズを削減するために、まずアーキテクチャのパラメータ数を削減する構造的圧縮を行い、その後、残った重みを4ビットに量子化するという手法が標準的となっています。しかし、この「圧縮してから量子化する」プロセスを経ると、推論能力、数学的推論
近年、最も興味深いAIアプリケーションは、単一の機能ではなく、複数のステップを連携させたパイプラインとして構成されています。例えば、画像を生成した後で背景を切り抜いたり、スクリプトを生成した後に音声合成を行ったりといった一連の処理がこれにあたります。従来、これらのステップはPythonコー
Hugging Faceは、オープンAI研究の普及と理解を促進するため、「Papers with Code」の活動を再開しました。このプラットフォームの目的は、研究者が論文に関連する成果物を見つけたり、様々なAI分野における最先端(SOTA)を把握したり、研究を共有・発展させたりできるよう
公開されている音声認識(ASR)のベンチマークスコアは、モデルが人間のレベルに達していることを示唆していますが、これらのスコアが実際の運用環境での性能を正確に反映していないという問題が指摘されています。広く利用される公開ベンチマークは、モデルがテスト自体のパターンを学習し、根本的なタスク能
Hugging Faceは、LFM2.5ファミリーの3つのモデル(LFM2.5-1.2B-Instruct、LFM2.5-2.6B、LFM2.5-8B-A1B)向けに、DSparkドラフトモデルのチェックポイントをリリースしました。このDSparkは、推論のデコードパスに「推測的デコーディ
PythonライブラリであるSentence Transformersが、v6.0のアップデートにより「MultiVectorEncoder」という新しいモデルタイプを導入しました。これは、ColBERTスタイルの「遅延相互作用(Late Interaction)」検索を可能にする機能です
本発表では、エンタープライズAIにおける次の制約は「知性」ではなく「利用率」にあるという指摘に基づき、成熟したGPU管理プラクティスを具体的に示した制約認識型GPUアロケータが紹介されました。この新しいアロケータは、従来のFIFO(先入れ先出し)スケジューラと比較検証され、同一のハードウェ
本記事は、Strands Robots、LeRobot、およびHugging Face Storage Bucketsを統合的に利用することで、ロボットのデモンストレーション記録から学習、そしてポリシーの再展開までの一連のデータループを単一の場所で完結させる方法を解説しています。Stran
Allen AIが提供する地球観測モデルプラットフォーム「OlmoEarth Studio」において、地球観測データから生成される埋め込みベクトル(embedding vectors)の計算とエクスポート機能が利用可能になりました。この埋め込みベクトルは、地球観測データのコンパクトな数値表
Google Researchは、日常的なスマートフォン利用中に、前面カメラで撮影した顔の動画から心拍数(HR)と安静時心拍数(RHR)を非侵襲的に測定する研究システム「PHRM」を発表しました。心拍数は、活動レベルやストレス、病気など生理的状態を示す重要な指標であり、RHRは心血管の健康
Google Researchは、洪水予測の精度向上を目的とした水文モデリングフレームワークをGitHubでオープンソース化しました。このモデルは、国家気象・水文サービスがAIベースの洪水予測を自らのワークフローに統合できるように提供されます。研究者や予報士は、このフレームワークを利用して
NASAは、インスピレーション・ツアーの一環として、F-5戦闘機を3機使用したフライオーバーを実施する。NASA局長であるジャレッド・アイザックマンが、このうちの1機を操縦し、10月11日日曜日にニュージャージー州イーストラザーフォードで行われるニューヨーク・ジェッツ対クリーブランド・ブラ