Gemma
Google DeepMindによって開発された大規模言語モデル
From Wikipedia, the free encyclopedia
Gemma(ジェマ)は、Googleが提供する小規模言語モデル (SLM) のファミリー[3]。同社の大規模言語モデル (LLM) であるGeminiと同様の技術に基づく、開発者向けの軽量なオープンモデル[注釈 1]であり[6][4]、Geminiの軽量版と位置付けられている[3]。Google DeepMindとGoogle の他のチームによって開発された[6]。名称「Gemma」は、ラテン語で宝石を意味する "gemma" に由来する。
|
| |
| 開発元 | Google DeepMind |
|---|---|
| 初版 | 2024年2月21日[1] |
| 最新版 |
Gemma 4
/ 2026年4月2日[2] |
| 種別 | 小規模言語モデル[3] |
| ライセンス |
|
| 公式サイト |
ai |
GoogleはGemmaを「AIをすべての人にとって役立つものにする」というミッションを支援するものとして説明している[7]。また、Googleは医療分析用のMedGemmaなど、特定の用途に最適化された公式のGemma派生モデルを公開している[8]。
歴史
各モデルの詳細については、#モデル一覧を参照。
Gemma (初代)
2024年2月21日(米国時間)[4][9]、GoogleはGeminiの軽量版として機能するフリーかつオープンソースなSLMファミリーであるGemmaを公式ブログ上で紹介した[4][9]。Gemma 2BとGemma 7Bの2つのサイズのモデルが公開され、パラメータ数はそれぞれ20億 (2B) と70億 (7B) である[3][4][9][10]。
GoogleがオープンモデルのGemmaをリリースした際、複数のマスメディアは、MetaなどがAIモデルをオープンソース化していることへの対抗であり、Googleが長年AIを独自のものとして保持してきた方針からの劇的な転換であると報じた[11][12][13]。
Gemma 2
Gemma 3
2025年3月12日、Gemma 3(ジェマ スリー)がリリースされた[17][18][5]。
Gemma 3は、2億7000万、10億、40億、120億、270億 (270M, 1B, 4B, 12B, 27B) のパラメータサイズで公開され、140以上の言語をサポートしている。マルチモーダルモデルとして、270Mと1Bはテキストのみ[19]、それ以外はテキストと画像の両方の入力に対応している[20]。さらに、Googleはスマートフォン、ノートパソコン、タブレットなどのデバイスでの実行に最適化された小型モデルであるGemma 3nも公開している[21]。
Gemma 3は、グループクエリアテンション (GQA: grouped-query attention) とSigLIPビジョンエンコーダを備えたデコーダのみのTransformerアーキテクチャに基づいている。4B、12B、27Bのコンテキスト長は128Kであるが、270M及び1Bのコンテキスト長は32Kである[22][23]。
Gemma 3では、量子化対応トレーニング (QAT: quantization-aware training) を使用してファインチューニングされた量子化バージョンも利用可能である[23]。これはメモリ使用量を大幅に改善するが、精度と正確さ (precision) に多少の悪影響を及ぼす[24]。
Google Deepmindは、Gemmaシリーズの初版公開から2025年5月11日(米国時間)までに、モデルのダウンロード数が1億5,000万回を超えたことを発表した[25][26]。
また、Hugging Faceでは、コミュニティや個人によるファインチューニング版や量子化版を含め、7万以上のモデルが利用可能となった[26]。
Gemma 4
2026年4月2日、Gemma 4(ジェマ フォー)がリリースされた[2]。
Gemma 4は、E2B、E4B、26B A4B、31Bのパラメータサイズで公開され、全モデルが画像と動画の入力に対応しており、E2BとE4Bはそれらに加えて音声の入力にも対応している[27]。
公式派生モデル
Googleは、医療分析やプログラミングなど、特定の目的のために設計されたGemmaの公式派生モデルを開発している。
- ShieldGemma 2 (4B) - Gemma 3ファミリーに基づく、暴力的、危険、および性的に露骨な画像を識別およびフィルタリングするためのモデル[28]。
- MedGemma (4Bおよび27B) - 同じくGemma 3に基づく、画像分析などの医療アプリケーション向けのモデル。しかし、GoogleはMedGemmaが「まだ臨床レベルではない」ともしている[29]。インドのグルグラムにあるTap Healthの開発者は、MedGemmaを使用してAI支援による糖尿病管理アプリケーションを強化している[30][31]。
- DolphinGemma (約400M) - ジョージア工科大学の研究者およびWild Dolphin Projectとの協力で開発された、音声分析を通じてイルカのコミュニケーションをより良く理解することを目的としたモデル。モデルやデータは公開されていない[32][33]。
- CodeGemma (2Bおよび7B) - コード補完および一般的なコーディングのために設計されたモデル群[34]。Python、Java、C++など、複数のプログラミング言語をサポートする[35]。
- TranslateGemma (4B、12B、27B) - Gemma 3をベースに、Geminiからの蒸留と強化学習でチューニングされた翻訳特化のモデル。パラメータ数がより多いGemma 3 27Bの翻訳性能を、TranslateGemma 12Bモデルは上回る。55言語を公式サポートしている[36]。
モデル一覧
オープンウェイトモデルは、推論時にコンテキスト長を再スケーリングできる。Gemma 1、Gemma 2、PaliGemma、およびPaliGemma 2では、コスト(KVキャッシュのサイズ)は、コンテキスト長に比例して増加する。Gemma 3では、ローカルアテンションとグローバルアテンションの分離により、成長曲線が改善されている[23]。RecurrentGemmaでは、2048トークン後のメモリ使用量は変わらない[37]。
| 世代 | リリース日 | パラメータ数 | コンテキスト長 | マルチモーダル | 備考 |
|---|---|---|---|---|---|
| Gemma 1 | 2024年2月21日 | 2B, 7B | 8192 | 非対応 | 2Bモデルは7Bから蒸留 (distilled) されたもの。2Bはマルチクエリアテンションを使用し、7Bはマルチヘッドアテンションを使用。 |
| CodeGemma | 2024年4月9日[38] | 2B, 7B | 8192 | 非対応 | コード生成用にファインチューニングされたGemma 1。 |
| RecurrentGemma | 2024年4月11日 | 2B, 9B | 無制限(モデル学習時は8192トークン) | 非対応 | Transformerベースではなく、Griffinベース[37]。 |
| Gemma 2 | 2024年6月27日 | 2B, 9B, 27B | 8192 | 非対応 | 27Bはウェブドキュメント、コード、科学論文から学習。Gemma 2 9Bは27Bから蒸留。Gemma 2 2Bは未リリースの7Bモデルから蒸留。グループクエリアテンション (Grouped-Query Attention) を使用[39]。 |
| PaliGemma | 2024年7月10日 | 3B | 8192 | 画像 | テキストと画像を入力として受け取り、テキストを出力する視覚言語モデル。SigLIP-So400m画像エンコーダとGemma v1.0 2Bを接続して作成[40][41]。 |
| PaliGemma 2 | 2024年12月4日 | 3B, 10B, 28B | 8192 | 画像 | SigLIP-So400mとGemma v2.0 2B、9B、および27Bを組み合わせて作成。より多くの視覚言語タスクが可能[42][43]。 |
| Gemma 3 | 2025年3月12日 | 270M, 1B, 4B, 12B, 27B | 32K(270M / 1B) / 128K | 画像 | 全モデルが蒸留により学習。事後学習は数学、コーディング、チャット、指示追従、多言語(140言語対応)に重点。関数呼び出しが可能。270M、1Bは視覚機能非対応[19][44][45]。 |
| Gemma 3n | 2025年6月26日 | E2B, E4B | 32K | 画像・音声 | スマートフォン、ノートパソコン、タブレットなどのデバイスでの実行に最適化された小型モデル。Matryoshka Transformer(MatFormer)構造を採用。PLE(Per-Layer Embedding)キャッシュや条件付きパラメータ読み込みにより、メモリ使用量と計算コストを削減可能。[21] |
| TranslateGemma | 2026年1月15日 | 4B, 12B, 27B | 2K[46] | 画像 | Gemma 3をベースにGeminiからの蒸留(SFT/RL)で構築された翻訳特化モデル。55以上の主要・低リソース言語に対応。画像内のテキスト翻訳機能も保持している。[36] |
| Gemma 4 | 2026年4月2日 | E2B, E4B, 26B A4B, 31B | 128K(E2B/E4B) / 256K | 画像・動画・音声(E2B/E4B) | 推論(思考)モードを標準搭載したマルチモーダルモデル。動画はフレームとして処理。ハイブリッドアテンション(スライディングウィンドウ+グローバル)を採用。26B A4BはMoEモデル。E2B/E4Bのみ音声入力に対応。[27] |