
ELYZAの国産推論AI、商用利用できても「完全自動開発」ではない

ELYZAは2026年10月2日の公式発表で、国立情報学研究所が開発したllm-jp-4を基盤とする推論モデル「ELYZA-Thinking-1.0-llm-jp-4-33b」と「ELYZA-Thinking-1.0-llm-jp-4-32b-a3b」の2種を、商用利用できる形で公開した。社内の学習基盤を使った中間学習から事後学習、評価までの工程では、人が介在する作業を1〜2人日程度に抑えた。同時に研究組織「ELYZA RSI Research」も設立されたが、今回の成果は再帰的自己改善(RSI)に至る前段階と位置づけられている。
両モデルの重みはHugging Faceで無料配布され、ライセンスはApache 2.0だ。同日付のITmedia AI+の報道は、当初使った「完全国産」という表現を修正し、ELYZAによる「『完全国産』という日本語訳のニュアンスがわれわれの想定と異なった」との説明を掲載した。ここで確認できる開発経緯は、日本で事前学習されたllm-jp-4を土台に、ELYZAが追加学習したというものだ。無料で重みを取得できることは、動かすための計算資源まで無料になることを意味しない。
Dense型とMoE型は、計算量と重みの保持量を分けて比べる
2モデルの総パラメータ数は近いが、回答を生成するときに計算へ参加する重みの範囲が異なる。33B版はDense型で、各層の重みを推論に使う。32B-A3B版はMoE型で、保持する専門部分の中から入力に応じて一部を選ぶ。名称中の「A3B」は推論時に有効になる規模の目安であり、モデル全体を3B級のメモリに収められるという意味ではない。
- 33B Dense版:総パラメータは約33Bで、推論時の計算には原則としてモデル全体の重みが関わる。BF16で各パラメータを2バイトとして単純計算すると、重みだけで約66GBになる。
- 32B-A3B MoE版:総パラメータは約32B、推論時に有効になる部分は約3Bが目安となる。同じBF16での単純計算では重み全体が約64GBとなり、計算する部分が小さくても全体を保持する領域は必要だ。
- 共通する利用条件:いずれもApache 2.0で商用利用できる。配布される重みとは別に、推論ソフトウエアと、重みや生成中のデータを扱える実行環境を用意する。
- 性能判断の対象:日本語の質問応答や複数条件を守る指示、コード生成、関数呼び出しなど、利用する機能に近い評価項目を見る。総合平均だけでは、その用途での失敗の仕方は分からない。
約66GBと約64GBは、パラメータ数に2バイトを掛けた重みだけの概算だ。GPUメモリの必要量を保証する値ではなく、生成中の情報を保持する領域や推論処理系の分も加わる。入力が長くなる場合や同時に複数の要求を処理する場合は、その分の余裕も要る。量子化すれば重みの容量は変わるが、精度や速度も変わり得るため、元の重みでの評価値をそのまま当てはめられない。
20種類の評価は、平均より課題ごとの差が重要
公開評価は、知識・理系、数学、日本語の質問応答、指示追従、翻訳、コーディング、関数呼び出しにまたがる20種類のベンチマークを扱う。MoE版のモデルカードに載る総合平均は58.46で、比較欄のllm-jp-4-32b-a3b-thinkingは46.38、llm-jp-4.1-32b-a3b-thinkingは53.89だった。日本語に該当する課題だけの平均は、それぞれ59.61、49.16、56.65である。これらは掲載された評価構成での結果であり、商用環境での正答率を表す数字ではない。
平均の作り方にも意味がある。各ベンチマークをまず能力群ごとに平均し、さらに群をまたいで平均しているため、個別の課題で大きな差があっても総合値には埋もれ得る。例えばMoE版のJFBenchは38.15、比較欄のllm-jp-4.1-32b-a3b-thinkingは30.87だった。一方、同じ表のJMMLUではMoE版が81.05、比較対象が83.09で、項目によって優劣は入れ替わる。複数条件への追従を重視する利用と、知識問題への回答を重視する利用では、見るべき行が違う。
関数呼び出しの評価では、使用した形式が並列呼び出しに対応しないため、比較する全モデルから並列呼び出しを除いている。生成時の設定や出力上限も結果に関わる。したがって、関数を同時に呼ぶ構成の成否を、この表の得点から直接判断することはできない。ツールの選択、引数の形式、最終回答まで含めて使う環境で評価する必要がある。
追加学習では、数学・コード・理系の推論データを日本語化し、日本語固有の知識や複数の検証可能な条件を含む指示も扱っている。公開された課題別の数値は、その狙いに対する手掛かりになる。ただし、社内文書の固有表現、長い入力、許容できない誤答、実際の応答時間は、公開ベンチマークとは別の条件だ。商用導入時には、自社データでの正確さに加え、指示違反とツール操作の失敗を同じ実行構成で測ることになる。
商用利用できる重みを動かすための条件
Apache 2.0による商用利用と、すぐに使えるホスト型サービスの提供は別の話だ。公開されているのは取得して実行環境に載せるモデルの重みである。配布ページにはvLLMを用いた実行手順があり、推論内容と最終回答を分けて取り出す設定や、ツール呼び出し用の設定も示されている。単に重みを読み込むだけでは、想定した応答形式や外部機能の呼び出しまで再現できるとは限らない。
MoE版を選ぶ理由は、主に推論時に計算へ参加する重みを絞れる点にある。総パラメータの近いDense版と比べて、保存する重みが同じ割合で小さくなるわけではない。処理速度も入力の長さ、同時処理数、使うソフトウエアや機器に左右されるため、「A3B」という名前だけで必要なGPUや運用費を決めることはできない。
ライセンス面でも、無料配布という言葉だけで判断は終わらない。Apache 2.0は商用利用を認めるが、導入先の入力データをどこで処理し、誰が出力を確認し、誤った回答やツール操作をどう扱うかは利用する側の設計に属する。特に外部システムへ操作を渡す用途では、文章として自然な回答だけでなく、選択した機能と引数、操作後の状態まで評価対象になる。
人的作業1〜2人日と、RSI研究の現在地
1〜2人日という数字が示すのは、整備した学習基盤をllm-jp-4に適用し、中間学習、事後学習、評価を進めた工程で人が介在した作業量だ。基盤モデルの事前学習から研究目標の設定までを含む総工数ではない。人の関与を小さくした成果として捉えられる一方、この数字からモデル開発全体が自動化されたとは言えない。
研究組織が目指すRSIは、AIが自身の能力や開発過程を反復して改善し、得た成果を次の改善に使う状態を指す。今回の公開では、基盤モデルの追加学習に加え、評価用ベンチマークの半自動作成と、AIエージェントの動作やツール利用を制御する仕組みの改善が示された。個々の工程にAIを使うことと、開発を担うAI自身を含めて改善を継続することには、まだ隔たりがある。
その違いは研究成果の数字にも表れる。問い合わせ応答業務向けの評価では、改善に使っていないテストデータの完遂率が34.3%から52.9%へ上がった。これはAIエージェントの動作を支える仕組みを改善した実験の結果であり、公開された推論モデル単体の得点ではない。モデルの採用判断にこの改善幅を移すことはできないが、評価結果を次の開発へ返すという研究の方向は具体的に示している。
現在利用できるのは、公開時点の条件で配布されたモデルだ。研究構想では、今後、モデルや周辺の仕組みだけでなく、開発と改善を担うAIエージェント自身も改善対象に含める。そこまでの反復が継続して成立するかは、今後の研究成果で示されることになる。
関連記事:
関連記事
ニュースレターを購読
Web3、AI、暗号資産の最新ニュースを受信箱にお届けします。




