AI Topica

ニュース

transformers、llama.cppのGGUF量子化モデルを直接読み込み可能に

ノートPCで生成AIを動かす手段は、これまでllama.cpp系の専用ツールに頼る場面が多くありました。Hugging Faceが公開したtransformersの新機能は、その手間を減らす方向の変更です。検証や評価をPythonの通常環境で完結させたい担当者にとって、選択肢が一つ増えます。

何が起きたか

Hugging Faceは公式ブログで、機械学習ライブラリ「transformers」がllama.cppの量子化フォーマット「GGUF」を直接読み込めるようになったと発表しました。Hugging Face Hub上のGGUFチェックポイントをfrom_pretrainedに渡すだけで、ノートPCのメモリに合わせたモデルを手元の端末で動かせます。

現時点の対応はApple Silicon搭載Macが対象で、まずQwen3.5アーキテクチャから始まります。処理速度を高めるため、llama.cppが使うggmlのMetalカーネルを「kernels」ライブラリ経由で再利用する仕組みです。

ベンチマークでは、MacBook Pro M2 Max(32GBメモリ)で計測した3種類のGGUFチェックポイントについて、transformersの生成速度がllama.cppの専用ベンチマークツールに近い水準だったと公表されています。あわせて、OpenAI互換APIを備える「transformers serve」からもGGUFモデルを呼び出せるようになりました。

背景・解説

GGUFとは、llama.cppチームが開発したローカル推論向けのファイル形式で、モデルの重みとトークナイザー情報、チャットテンプレートなどを1つのファイルにまとめています。精度を落として容量を小さくする「量子化」に対応しており、Unslothが公開するQwen3.5-4Bの場合、量子化前は8.42GBだったファイルサイズが、Q4_K_Mという量子化形式では2.74GBまで縮みます。

llama.cppは、Ollama・LM Studio・Janといったローカル動作向けAIツールの推論エンジンとして使われてきました。一方でtransformersは、Hugging Faceが提供するモデル定義の標準的な基盤という位置づけです。これまでtransformersでGGUFモデルを直接扱うことは想定されておらず、ローカル実行はllama.cpp系のツールが担う役割分担でした。今回の対応により、両者の役割が近づいたとHugging Faceは説明しています。

仕事や業務への影響 — AI Topicaの見方

社内でAIモデルの検証を担当する情シス担当者は、専用ツールを追加導入せずに評価作業を始められます。例えば、30人規模のコールセンターを運営する企業で、情シス担当者が1人で問い合わせ要約AIの精度を確認する場面を想定します。従来はllama.cpp向けのツールとPythonの分析環境を別々に用意する必要がありましたが、今後はtransformersのAPIだけでGGUFモデルを読み込み、既存の評価コードにそのままつなげられます。

出典の例では、量子化前に8.42GBあったQwen3.5-4Bのファイルが、Q4_K_Mという形式では2.74GBまで小さくなります。メモリ16GB程度のノートPCでも、量子化モデルなら手元の端末で動作確認ができる計算です。

一方で、対象は当面Apple Silicon搭載のMacに限られます。Windows PCやLinuxサーバーを使う情報システム部門は、同じ手順をそのまま試すことができません。量子化の種類によって回答品質は変わるため、契約書レビューのように誤りが許されない業務では、Q4_K_Mのような軽量形式だけでなく、より精度の高いQ6_Kとの比較を先に行うべきです。社内向けのメモ整理や下書き作成のように、多少の誤りを許容できる用途なら、軽量な量子化で十分です。

不確かな点・注意

今回の対応は現時点でApple Silicon搭載Macが前提で、対応するPyTorchのバージョンも直近2つ程度に限られると説明されています。互換カーネルが取得できない場合は重み全体をメモリ上に展開する処理に切り替わり、使用メモリが増えるとされています。

ベンチマークはHugging Face自身が1台のMacBook Pro M2 Maxで計測した数値であり、他の機種やモデルでも同じ結果になるとは限りません。量子化による回答品質への影響はモデルやタスクによって異なるため、業務に適用する前に対象タスクでの評価が必要です。Hugging Face自身も、ローカル推論の効率を最優先する場合の推奨エンジンは引き続きllama.cppだとしています。

出典

  1. Transformers now runs llama.cpp quants

AI Topica 編集部