ニュース
4BのAIがPostgreSQL超え クエリ最適化で1.81倍高速化と報告
データベースの応答速度に悩む企業は少なくないはずです。バックエンドエンジニアのロハン・バンサル氏が、わずか40億パラメータの小型AIを訓練し、PostgreSQLの標準的なクエリプランより高速なプランを生成できたと報告しました。大規模モデルに頼らずとも、特定業務に強い小型モデルを社内で使う道が見えてきた事例です。
何が起きたか
バックエンドエンジニアのロハン・バンサル氏が、データベースのクエリ最適化を小型の言語モデルに担わせる研究結果を報告しました。氏によると、パラメータ数40億(4B)のモデルに教師ありファインチューニング(SFT)と強化学習(RL)を施したところ、PostgreSQLの標準的なクエリプランを上回る性能を発揮したといいます。
訓練では拡張機能「pg_hint_plan」を使い、モデルに特定の実行プランを指示する「ヒント」を生成させました。教師モデルにはGPT-6 AstraとQwen 3.8 2.4Tのどちらを使うかを多面的に評価した上で、GPT-6 Astraを選んだと説明しています。
結合処理の負荷が高い113個のクエリで構成される「結合順序ベンチマーク(JOB)」で評価したところ、PostgreSQLの標準プランに対して幾何平均で1.81倍のスピードアップを達成したと報告しています。
背景・解説
クエリ最適化とは、データベース管理システム(DBMS)がデータを取り出す際に、どの順序でテーブルを結合し、どの方法でスキャンするかを決める処理のことです。テーブルの結合順序を決める作業はNP困難な問題であり、PostgreSQLのような成熟したクエリオプティマイザーでも、常に最速のプランを選べるとは限りません。
オプティマイザーは実際にデータを結合して行数を数える代わりに、統計情報をもとにした推定値でコストを見積もっています。その際、あるテーブルの値の分布を別のテーブルにもそのまま当てはめる「一様分布の仮定」を用いますが、この仮定が外れると誤差が結合処理全体に波及し、実行時間が大きく悪化することがあります。
今回の研究は、この推定の弱点をPostgreSQLのソースコードを変更せずに補う手段として、LLMに実行プランへの「ヒント」を出させる方法をとりました。
仕事や業務への影響 — AI Topicaの見方
データベースの応答が遅いという悩みを抱える企業ほど、この種の技術に投資する意味があります。例えば、従業員300人規模のECサイト運営会社で、情報システム部門の担当者2人が毎晩のバッチ処理で数百件のJOINクエリの遅延に対応している場合、クエリプランの改善は夜間バッチの完了時刻を早め、翌朝の在庫反映の遅延を防ぐことにつながります。
今回の報告は、40億パラメータという比較的小さなモデルでも、特定のタスクに絞って訓練すればPostgreSQL標準のプランを上回れることを示しました。これは、巨大な汎用モデルを都度呼び出さなくても、自社のクエリパターンに特化した小型モデルを社内で運用できる余地があることを意味します。
ただし、この成果はIMDbデータをもとにした113個のベンチマーククエリでの結果であり、自社のスキーマやデータ分布でそのまま同じ倍率が出るわけではありません。クエリ最適化にコストをかける前に、まず自社で実際にボトルネックとなっているクエリを月次で洗い出す作業から始めるべきです。
SQL文の実行計画を月に1回も確認していない企業であれば、モデル導入より先に既存クエリの棚卸しが優先事項になります。一方、扱うクエリが少ない小規模なコーポレートサイトの運営者には、こうした最適化技術の導入は不要です。
不確かな点・注意
今回の内容はバンサル氏個人による報告であり、査読を経た論文としての公開ではありません。
評価に使われたIMDbデータセットと113個のクエリという条件は限定的で、実務で使われる多様なスキーマや大規模データでも同じ倍率が出るかどうかは分かりません。
教師モデルとして挙げられている「GPT-6 Astra」や「Qwen 3.8 2.4T」については、本記事の出典以外での情報は確認できませんでした。
訓練にかかった時間やコスト、他のデータベース製品への応用可能性も明らかになっていません。