LLM Benchmark 2026Q3
日本語 実務LLMランキング
秘匿環境で使えるオープンモデルを実測
議事録要約とRAG引用正確性という日本語の業務タスクで、オープンウェイト13モデル・19構成を同一条件で実測しました。 デスクトップAIマシンでの4bit量子化ローカルと、GPUサーバー級(BF16)の両方を比較する四半期レポートです。
- ①デスクトップAIマシン(36GB級・量子化ローカル)の最有力は Gemma 4 26B-A4B(忠実度1.85・引用F1 0.994・54 tok/s)
- ②GPUサーバー級(BF16)は Qwen3.5-122B-A10B と Gemma 4 31B が最上位
- ※順位以上に効くのは運用要因。MoE型の速度優位・量子化方式・配信元プロバイダの差を実測で確認
TL;DR
先に、ざっくり結論
- 議事録要約なら、デスクトップ級(メモリ36GB)で動くローカルの最有力は Gemma 4 26B-A4B。RAG引用の正確性も、上位はローカルで到達できます。
- 必要なセキュリティは段階で選びます。レベル1 クラウド+統制(非学習設定・監査ログ・入力ルール)/レベル2 ハイブリッド/レベル3 秘匿・ローカル。用途の機微度で決めます。
- 大手3モデルも実測しました(2026年7月)。日常業務(議事録・RAG)では大手と強いオープンモデルはほぼ横並びでした。一方、営業日をまたぐ期日計算や、複数の書類を突き合わせた金額集計など、難度を上げた多段処理では大手3モデルが明確に上回りました(正答ほぼ100%に対しローカルは40〜85%)。単純な1回照合や「答えられない質問を断る」課題は、どのモデルもほぼ満点。つまり「日常業務なら手元のモデルで十分、難しい多段処理は大手が要る」が、実測の答えです。10タスクの横断比較表を見る →
Rankings
タスク別ランキング Top 10
①はデスクトップ級での4bit量子化ローカル、②はGPUサーバー級(量子化なしのBF16精度)です。 スコアの僅差(0.05程度)は誤差の範囲としてお読みください。
議事録要約(事実忠実度、0〜2)
| 順位 | モデル | レーン | 忠実度 |
|---|---|---|---|
| 1 | Qwen3.5-122B-A10B | ② | 1.93 |
| 2 | Qwen3.6-27B | ② | 1.90 |
| 3 | Gemma 4 31B | ② | 1.88 |
| 3 | Qwen3.6-35B-A3B | ② | 1.88 |
| 5 | Gemma 4 26B-A4B | ② | 1.87 |
| 6 | Gemma 4 26B-A4B | ① | 1.85 |
| 7 | Gemma 4 31B | ① | 1.82 |
| 8 | Qwen3.6-35B-A3B | ① | 1.73 |
| 9 | Qwen3.6-27B | ① | 1.70 |
| 10 | gpt-oss-120b | ② | 1.60 |
RAG引用(引用F1、0〜1)
| 順位 | モデル | レーン | 引用F1 |
|---|---|---|---|
| 1 | Gemma 4 26B-A4B | ② | 1.000 |
| 1 | Gemma 4 31B | ② | 1.000 |
| 1 | Qwen3.6-27B | ② | 1.000 |
| 4 | Gemma 4 26B-A4B | ① | 0.994 |
| 4 | Gemma 4 31B | ① | 0.994 |
| 6 | Qwen3.6-27B | ① | 0.991 |
| 7 | Qwen3.6-35B-A3B | ① | 0.977 |
| 8 | GLM-4.7-Flash | ② | 0.959 |
| 9 | llm-jp-4-32b-a3b | ① | 0.947 |
| 10 | Qwen3.5-122B-A10B | ② | 0.930 |
BF16級が上位を占めるのは自然な結果ですが、量子化ローカルの①勢、特にGemma 4の2構成が僅差で食い込んでいます。
Quality × Speed
デスクトップで「使える」のはどれか?品質×速度の一枚絵
①レーン(4bit量子化ローカル)の議事録タスクにおける、事実忠実度と実効速度の分布です。 右上にあるほど「賢くて速い」。Gemma 4 26B-A4Bが品質と速度の両立で頭ひとつ抜けています。dense型(Gemma 4 31B、Qwen3.6-27Bなど)は品質が高くても速度が出にくく、 用途によっては待ち時間がネックになります。
Full Results
導入パターン別の詳細結果
①デスクトップAIマシン(36GB級・4bit量子化ローカル)
| モデル | 議事録 忠実度 | 決定一致 | 形式 | RAG 引用F1 | 根拠性 | tok/s 議事録/RAG |
|---|---|---|---|---|---|---|
| Gemma 4 26B-A4B | 1.85 | 1.59 | 0.95 | 0.994 | 2.00 | 54 / 8 |
| Gemma 4 31B | 1.82 | 1.64 | 1.00 | 0.994 | 2.00 | 9 / 1 |
| Qwen3.6-35B-A3B | 1.73 | 1.62 | 1.00 | 0.977 | 1.98 | 65 / 10 |
| Qwen3.6-27B | 1.70 | 1.57 | 1.00 | 0.991 | 1.98 | 11 / 1 |
| GLM-4.7-Flash | 1.52 | 1.48 | 1.00 | 0.603 | 1.21 | 40 / 18 |
| Qwen3-Swallow-32B-RL | 1.48 | 1.52 | 1.00 | 0.772 | 1.95 | 8 / 2 |
| llm-jp-4-32b-a3b | 1.45 | 1.57 | 0.97 | 0.947 | 1.91 | 85 / 41 |
| GPT-OSS-Swallow-20B-RL | 1.05 | 1.23 | 0.88 | 0.708 | 1.53 | 91 / 54 |
| gpt-oss-20b | 0.97 | 1.32 | 0.90 | 0.711 | 1.76 | 80 / 49 |
| llm-jp-3.1-13b(旧世代・参照用) | 0.85 | 1.35 | 0.93 | 0.512 | 1.24 | 18 / 7 |
②自社GPUサーバー級(BF16)
| モデル | 議事録 忠実度 | 決定一致 | 形式 | RAG 引用F1 | 根拠性 | 矛盾検出 | 詐称 |
|---|---|---|---|---|---|---|---|
| Qwen3.5-122B-A10B | 1.93 | 1.60 | 1.00 | 0.930 | 1.96 | 2.00 | 0/12 |
| Qwen3.6-27B | 1.90 | 1.52 | 0.93 | 1.000 | 1.93 | 2.00 | 0/12 |
| Gemma 4 31B | 1.88 | 1.62 | 0.97 | 1.000 | 2.00 | 2.00 | 0/12 |
| Qwen3.6-35B-A3B | 1.88 | 1.57 | 0.85 | 0.877 | 1.89 | 2.00 | 0/12 |
| Gemma 4 26B-A4B | 1.87 | 1.57 | 1.00 | 1.000 | 2.00 | 1.83 | 0/12 |
| gpt-oss-120b | 1.60 | 1.52 | 1.00 | 0.696 | 1.93 | 2.00 | 0/12 |
| gpt-oss-20b | 1.57 | 1.55 | 0.95 | 0.889 | 1.93 | 2.00 | 0/12 |
| GLM-4.7-Flash | 1.56 | 1.60 | 0.97 | 0.959 | 1.98 | 2.00 | 0/12 |
スコアは0〜2(2が最良)、形式・引用F1は0〜1。tok/sはプロンプト処理を含む実効スループット。 詐称は回答不能な12問に対してもっともらしい回答を捏造した件数。
Cloud & Open Flagships
大手3社とオープン旗艦も、同じ物差しで測りました
上のランキングは秘匿環境で動かせるオープンモデルが主役ですが、「そもそも大手のクラウドAIと比べてどうなのか」は導入判断で必ず問われます。 そこで大手3社(GPT-5.6 Sol・Gemini 3.1 Pro・Claude Sonnet 5)と、重みが公開されている大型のオープン旗艦3種 (DeepSeek V4-Flash・DeepSeek V4-Pro・Kimi K3)を、日本語の実務10タスクで同一条件・同一採点者により実測しました。
この6モデルはいずれもAPI経由での利用=データが社外に出る前提です。秘匿環境での利用可否とは別の軸としてお読みください。
| タスク(指標) | 大手クラウド | オープン旗艦(重み公開) | ||||
|---|---|---|---|---|---|---|
| GPT-5.6 Sol | Gemini 3.1 Pro | Claude Sonnet 5 | DeepSeek V4-Flash | DeepSeek V4-Pro | Kimi K3 | |
| 議事録要約事実忠実度 0〜2 | 1.775 | 1.975 | 2.000 | 1.950 | 1.850 | 1.950 |
| RAG引用引用F1 | 0.895 | 1.000 | 0.982 | 0.994 | 0.994 | 0.820 |
| 期日・数値の多段計算正答率 | 1.000 | 0.975 | 1.000 | 0.975 | 0.950 | 1.000 |
| 構造化抽出項目正答率 | 0.967 | 0.992 | 0.979 | 0.992 | 0.983 | 0.979 |
| 答えられない質問の拒否判断正答率 | 1.000 | 1.000 | 1.000 | 1.000 | 1.000 | 1.000 |
| 書類をまたぐ照合・集計正答率 | 1.000 | 1.000 | 1.000 | 1.000 | 1.000 | 1.000 |
| 長文の矛盾統合値の正解率 | 1.000 | 1.000 | 1.000 | 1.000 | 0.975 | 1.000 |
| 翻訳の用語一貫性用語遵守率 | 1.000 | 0.995 | 1.000 | 0.975 | 0.995 | 1.000 |
| 文書の分類・振り分け完全一致率 | 0.975 | 0.925 | 0.875 | 0.900 | 0.900 | 0.975 |
| 複雑な制約遵守全制約の遵守率 | 1.000 | 1.000 | 1.000 | 1.000 | 0.950 | 1.000 |
| 10タスクの単純平均議事録は0〜1に正規化 | 0.972 | 0.987 | 0.984 | 0.981 | 0.967 | 0.975 |
各タスク40問(議事録40問・RAG57問)。太字は当該タスクの最高値。採点は上のランキングと同じ基準で、 意味の判断が必要な指標のみモデル名を伏せた自動採点を用い、期日・金額・形式などはプログラムで機械判定しています。 大手3社は2026年7月、オープン旗艦3種は8月の実測で、採点者は据え置きです。
難問8ジャンルで、秘匿ローカルはどこまで戦えるか
上の10タスクは大半のモデルが満点近くに張り付きます。そこで業務の難所だけを抜き出した8ジャンルで、 大手3社の最良値と、手元のデスクトップで動く4bit量子化ローカルの最良値を比べました。
| 業務ジャンル | 指標 | 大手3社 最良 | 秘匿ローカル 最良 | 差 | 判定 |
|---|---|---|---|---|---|
| 期日・数値の多段計算 | 正答率 | 1.000 | 0.850Gemma 4 31B | +0.150 | 大手優位 |
| 書類をまたぐ照合・集計 | 正答率 | 1.000 | 0.750Gemma 4 31B | +0.250 | 大手優位 |
| 構造化抽出 | 項目正答率 | 0.992 | 0.975Gemma 4 26B-A4B | +0.017 | 横並び |
| 長文の矛盾統合 | 統合スコア 0〜2 | 2.000 | 1.975Gemma 4 31B | +0.025 | 横並び |
| 文書の分類・振り分け | 分類F1(micro) | 0.990 | 0.980Gemma 4 31B | +0.010 | 横並び |
| 翻訳の用語一貫性 | 用語遵守率 | 1.000 | 1.000Gemma 4 31B | ±0.000 | 横並び |
| 答えられない質問の拒否 | 判断正答率 | 1.000 | 1.000Gemma 4 31B | ±0.000 | 横並び |
| 複雑な制約遵守 | 全制約の遵守率 | 1.000 | 1.000Gemma 4 31B | ±0.000 | 横並び |
各ジャンル40問。秘匿ローカルはデスクトップAIマシン(36GB級)での4bit量子化。 評価文書はすべて架空企業の合成データで、正解は評価前にプログラムで決定的に算出し、独立再計算で一致を確認しています。 n=40のため0.05程度の差は誤差の範囲です。
01
大手3社は、能力ではほぼ選べない
10タスクの単純平均は0.972〜0.987。8つの難問ジャンルでも3社のレンジは最大0.038で、実質互角でした。差が出た唯一の例は文書の振り分けで、しかも能力差ではなく誤りの癖(Claudeは過剰にラベルを付け、GPTは抑制的)です。選定軸は能力ではなく、価格・データの扱い・運用条件になります。
02
オープン旗艦は「安かろう悪かろう」ではなかった
DeepSeek V4-Flashの総合0.981はClaude Sonnet 5(0.984)と誤差圏で、GPT-5.6 Sol(0.972)を上回りました。入力単価は$0.14/MでSolの約1/36です。一方Kimi K3はRAG引用F1が0.820で6者最弱、生成も1件90秒級と遅く、用途を選びます。深い推論型のV4-Proは0.967で、この難易度帯では上位版の価値が出ませんでした。
03
秘匿ローカルが負けるのは「重い多段の数値処理」だけ
8ジャンルのうち6つで、手元の4bit量子化ローカル(Gemma 4 31B)は大手と横並びでした。明確に離されたのは期日の連鎖計算(0.850 対 1.000)と、複数書類をまたぐ金額集計(0.750 対 1.000)の2つだけです。この2種を含む業務なら大手かハイブリッド、それ以外は秘匿ローカルで足ります。
この比較の読み物版(note)
- DeepSeekやKimiは仕事で使える?日本語タスクの精度を検証しました ↗2026.08.05
- ChatGPT・Claude・Gemini、実際に測ったら「ほぼ互角」だった ↗2026.07.27
Findings
導入判断に効く4つの実測知見
01
デスクトップ運用はMoE型が前提になる
推論時に動くパラメータが小さいMoE型は実効40〜91 tok/sで実用になる一方、dense型はRAGで1〜2 tok/sまで落ちます。量子化への耐性でもMoE型が優位でした。
02
量子化は方式を誤ると「動くのに壊れている」状態になる
MXFP4で学習されたモデルを一般的なaffine方式で4bit化すると推論が崩壊し、二重量子化の変換物は流暢な文章のまま数値を捏造しました(忠実度0.41、適切な方式なら0.97)。変換の系譜確認が必須です。
03
ホスティングAPIは配信元プロバイダで品質が変わる
同一モデルでも特定の配信元経由では出力が壊れる事象を確認しました(97問中4問)。品質検収はモデル名ではなく配信元単位で行う必要があります。
04
「捏造」より運用設定がリスクの中心に
回答不能な質問への捏造は19構成中17構成でゼロ。一方、思考型モデルは生成上限の設定次第で回答が空になるなど、設定起因の問題が随所で起きました。
それぞれの詳細と数値はフルレポート(2026Q3)で解説しています。
Methodology
どうやって測っているのか?
評価タスクは、会議の文字起こしから決定事項とTODOを構造化する「議事録要約」(40問)と、 社内規程群から根拠つきで回答する「RAG引用正確性」(57問)。どちらも企業のLLM導入で最初に要求される仕事です。 データはすべて架空企業の合成データで、人手での確認を経て評価前に凍結しています。
採点は3段構えでスコアを担保しています。形式適合や引用照合はプログラムで機械判定し、 意味の判断が必要な指標はモデル名を伏せたルーブリック方式のLLM自動採点で行い、 さらにその自動採点自体を177件の人手による盲検採点と突き合わせて検証しました。
「一度できた」ではなく「毎回できるか」も測ります
精度だけでは足りません。同じ入力を繰り返したときに判定がブレるツールは、実務では信用できないからです。 そこで、同一問題を4回繰り返して判定が変わらないか(反復信頼性 pass^k)を実測しています。 業務スキルパックの4種すべてで pass^k は k=1〜4 でフラット、 回によって判定が変わる問題(flaky)は ゼロでした。 毎回同じ判定を出せることを数値で約束できるのが、成果連動での品質保証の裏づけになります。
pass^k の定義と参照実装は jitsumu-metrics(公開・MIT)。デスクトップ級ローカルLLMで、データを外に出さずに実測しています。
FAQ
よくある質問
このランキングはどうやって測っていますか?+
議事録要約(40問)とRAG引用正確性(57問)という日本語の業務タスクを自作し、全モデルを同一条件で実測しています。採点は機械判定・モデル名を伏せたLLM自動採点・人手の盲検検証(177件)の3段構えです。データはすべて架空企業の合成データで、評価前に凍結しています。
ChatGPTやClaudeなどのクラウドAIとの比較はありますか?+
あります。2026年8月の追記として、大手クラウド3社(GPT-5.6 Sol・Gemini 3.1 Pro・Claude Sonnet 5)と、重みが公開された大型のオープン旗艦3種(DeepSeek V4-Flash・DeepSeek V4-Pro・Kimi K3)を、日本語の実務10タスクで同一条件・同一採点者により実測しました。結論は「日常業務では大手と上位のローカルはほぼ横並び、差が出るのは営業日をまたぐ期日計算や複数書類の金額集計といった重い多段処理だけ」です。全数値は本ページの「大手3社とオープン旗艦も、同じ物差しで測りました」の章に掲載しています。なお四半期ランキング本体の主役は、データを外部に出さずに動かせるオープンモデルのままです。
順位はどのくらい信頼できますか?+
各構成1回の実行(議事録40問・RAG57問)のため、0.05程度の僅差は誤差の範囲としてお読みください。明確な差と傾向を読み取る用途に適しています。評価の制約条件はレポート本文に明記しています。
自社のタスクや文書で同じ評価はできますか?+
可能です。本評価と同じ基盤を貴社の実データ・実タスクに適用する「LLM選定アセスメント」(30万円〜・固定価格・2〜4週間)を提供しています。貴社版のモデルランキングと推奨構成、稟議に使える経営サマリを納品します。秘匿環境でのモデル選定に実測の根拠が欲しい場合はお問い合わせください。
あわせて読む・使う
秘匿AIとは?
データを外に出さずにAIを使う構成パターン4種と費用目安。本ランキングの導入パターン①②の解説
フルレポート 2026Q3
評価設計・全結果・4つの知見・制約条件まで。本ランキングの根拠となる読み物
レディネス診断(無料・3分)
データ保護・セキュリティを含む6軸でAIガバナンスの現在地を確認
本ランキングはモデル選定の参考情報です。性能は用途・データ・設定によって変わるため、 導入にあたっては実環境・実データでの検証をおすすめします。自社データでの評価はtokimoaが承っています。
PoCで止まっているAIを、
本番に出しませんか。
まずは30分の無料相談から。
Discovery 1ヶ月(35〜50万円)でお試しいただけます。無理に上位プランへ進む必要はありません。
tokimoa.jp/contact