仕事への影響
経理業務、AIが会計士の速度と精度を上回る 決算の最終判断は人の仕事
経理の数字合わせはすでにAIの方が速くて正確な領域に入りつつあります。ただし決算を丸ごと締める判断までAIに委ねられるかどうかは、まだ別の話です。経理担当者や会計部門の管理職にとって、どこまでをAIに任せ、どこからを人が握るべきかを考える材料になる調査結果が示されました。
何が起きたか
米Mercorが公表した調査によると、AIモデルは構造化された経理業務で、公認会計士より速く、正確で、コストも大幅に低く抑えられることが分かりました。調査では平均5.5年の実務経験を持つ公認会計士12人が、「APEX Accounting Benchmark」から抜粋した簡易版の課題に取り組みました。18カ月前の時点では、最も優秀なAIモデルでも会計士の平均正答率である約37%を下回っていましたが、現在はほぼ完璧に解けるようになったといいます。
フルバージョンのAPEX Accounting Benchmarkは、10社の模擬企業を舞台にした160件の課題で構成され、平均11年の経験を持つ40人以上の専門家が作成しました。この詳細なベンチマークでは、Claude Opus 5.5が採点基準の61.8%を満たして首位となり、Fable 5.1が61.0%、GPT-6 Astraが57.9%で続きました。Mercorは、課題全体の6割近くについて、どのモデルも完全には解けなかったとも明らかにしています。
背景・解説
APEX Accounting Benchmarkとは、会計士の実務に近い形式でAIの能力を測る評価基準を指します。帳簿の整合性確認や数値の突合といった、実際の経理業務を模した課題が用意されている点が特徴です。
今回Mercorが比較に使ったのは、このベンチマークから抜き出した簡易版の課題でした。細部を探し出し、指示を正確に守るという、AIが得意とする作業に偏っている点はMercor自身も認めています。実際の業務にある顧客との会話、同僚への確認、長年の経験で培った文脈理解といった要素は、今回の調査には含まれていません。Mercorはこうした理由から会計士の仕事が丸ごと置き換わるわけではないとしつつ、業界全体で生産性は大きく向上すると述べています。
仕事や業務への影響 — AI Topicaの見方
経理担当者が担ってきた「数字を合わせる」作業は、すでにAIの方が速くて正確な領域に入っています。例えば、経理担当が3人の小規模な部品メーカーで、毎月の帳簿突合や請求書照合に1人あたり20時間かけているなら、その作業の大部分をAIに任せて浮いた時間を取引先対応や資金繰りの検討に充てるべきです。
一方で、決算の締めそのものを丸ごとAIに任せるのは早計です。今回のベンチマークでも、上位モデルのClaude Opus 5.5でさえ採点基準の達成率は6割強にとどまり、課題全体の6割近くは完全に解けていません。帳簿を閉じる最終判断には、顧客との会話や過去の経緯を踏まえた文脈理解が欠かせず、これらは今回のテストの対象外でした。
例えば、年商50億円規模の食品商社で経理部長が月次決算を締める場合、仕訳の突合や数値検証はAIに下処理させても、取引先への確認連絡や特殊な会計処理の最終判断は担当者が自分の目で確認すべきです。AIに任せる範囲と人が握る範囲を事前に線引きしておけば、ミスを防ぎながら処理速度も上げられます。
経理部門の管理職は、採用や教育の方針も見直す必要があります。細部を拾って指示通りに処理する能力よりも、顧客との折衝力や例外処理の判断力を評価基準に加えるべきです。AIが基礎的な記帳作業を担うようになった分、人に求められる役割は「数字を作る」から「数字の意味を説明する」に移っていきます。
不確かな点・注意
今回の調査で使われたのは、本来160件ある課題のうち簡易版の一部です。公認会計士12人という人数も、業界全体を代表する規模とは言えないでしょう。
また、FableやGPT-6 Astraといったモデルの詳細な性能条件や評価方法は、本文からは十分に分かりません。顧客対応や長年の文脈理解を要する業務は今回のテスト対象外であり、実際の決算業務全体にそのままこの結果を当てはめるのは禁物です。日本企業の会計実務や会計基準への適用可能性についても、出典からは読み取れない点に注意が必要です。