AI Topica

ニュース

軽量VLM「LFM2.5-VL-3B」が最大2.9倍高速化、精度は維持

画像を読み込ませて使う社内AIツールは、応答の速さが業務の使い勝手を左右します。軽量な視覚言語モデルに高速化技術を組み合わせた新モデルの公開は、こうした現場の待ち時間を縮める材料になります。

何が起きたか

Liquid AIが、軽量な視覚言語モデル「LFM2.5-VL-3B」に投機的デコード技術「DSpark」を適用した新モデル「LFM2.5-VL-3B-DSpark」を公開しました。投機的デコードとは、メインのAIモデルとは別に小型で高速なドラフトモデルを用意し、出力トークンを先回りして予測する仕組みです。この方式により、出力の品質を維持したまま処理速度だけを引き上げられる点が特徴です。

今回追加されたドラフトモデルのパラメーター数は2億8000万で、総パラメーター数はLFM2.5-VL-3Bと比べて8.9%増えました。使用するメモリ容量も増加しますが、その分の速度向上は大きく、M5 MaxのMacBook Pro上でベンチマーク「MMMU-Pro」を実行したところ、デコード速度は2.93倍、プリフィルを含めた処理全体の速度も2.62倍に達しました。H100でも同様の結果が確認され、デコード速度は2.43倍、全体の処理速度は1.97倍に高速化しています。

背景・解説

視覚言語モデル(VLM)は、画像とテキストの両方を理解して応答を生成するAIモデルです。文章だけを扱う大規模言語モデル(LLM)と異なり、画像を数値の並び(多次元配列)に変換したうえで処理する工程が加わります。

投機的デコードは、この処理を高速化する技術のひとつです。小さなドラフトモデルが先に候補となる出力トークンを予測し、メインモデルはその予測が正しいかどうかを確認するだけで済むため、計算の手間を減らせます。Liquid AIによると、ドラフトモデルに渡されるのはメインモデルが変換した後のデータだけなので、入力が画像でも文章でも扱いは変わらないといいます。この特性のおかげで、これまでLLM向けに開発していたドラフトモデルの仕組みを、そのままVLM向けにも転用できたそうです。

仕事や業務への影響 — AI Topicaの見方

画像を扱う社内AIツールの応答待ちに悩む会社ほど、今回の高速化の恩恵は大きくなります。例えば、従業員80人ほどの製造業で、検査画像をAIに読み込ませて不良品を判定する社内システムを持っているとします。従来モデルで1枚あたり2秒かかっていた応答が、同じ精度を保ったまま1秒未満に近づく計算です。1日500枚の検査であれば、待ち時間の合計は数百秒単位で縮みます。

速度が上がっても出力品質は変わらないため、業務システムに組み込む際の判断基準は変わりません。導入担当者は精度確認の手間を追加でかける必要がなく、速度面の利点だけを受け取れます。

一方でメモリ使用量は増える設計です。オンプレミスのサーバーで複数のVLMを同時に動かしている情シス部門は、サーバーのメモリ容量に余裕があるかどうかを事前に確認しておくべきです。特にGPUメモリが限られる環境では、速度向上とメモリ増加のどちらを優先するか、部門ごとに判断する必要があります。

小型のVLMを画像検索や書類の要約、監視カメラ映像の解析に使っている会社であれば、応答速度の改善はそのまま業務のテンポの改善につながります。逆に、夜間にまとめて画像を処理するだけの会社では、速度向上の恩恵は限定的です。

不確かな点・注意

今回の発表では、日本語を含む多言語での性能に関する数値は示されていません。日本国内の業務データを使った場合に精度がどう変わるかは、現時点でわかっていません。

比較に使われたのはM5 MaxのMacBook ProとH100という2種類の環境だけで、企業が普段使うクラウド環境やCPUのみの環境での速度は不明です。増加したメモリ容量の具体的な数値や、利用条件、価格についても出典には記載がありません。導入を検討する場合は、自社の利用環境に近い条件での確認が必要です。

出典

  1. 軽量な視覚言語モデル「LFM2.5-VL-3B」にDSparkのドラフトモデルを適用して爆速化した「LFM2.5-VL-3B-DSpark」が登場

AI Topica 編集部