Wikiwand AI

Gemma

Google DeepMindによって開発された大規模言語モデル From Wikipedia, the free encyclopedia

Gemma(ジェマ)は、Googleが提供する小規模言語モデル (SLM) のファミリー[3]。同社の大規模言語モデル (LLM) であるGeminiと同様の技術に基づく、開発者向けの軽量なオープンモデル[注釈 1]であり[6][4]、Geminiの軽量版と位置付けられている[3]Google DeepMindとGoogle の他のチームによって開発された[6]。名称「Gemma」は、ラテン語宝石を意味する "gemma" に由来する。

初版 2024年2月21日 (2年前) (2024-02-21)[1]
最新版
Gemma 4 / 2026年4月2日 (5か月前) (2026-04-02)[2]
概要 開発元, 初版 ...
Gemma
開発元 Google DeepMind
初版 2024年2月21日 (2年前) (2024-02-21)[1]
最新版
Gemma 4 / 2026年4月2日 (5か月前) (2026-04-02)[2]
種別 小規模言語モデル[3]
ライセンス
公式サイト ai.google.dev/gemma ウィキデータを編集
テンプレートを表示
閉じる

GoogleはGemmaを「AIをすべての人にとって役立つものにする」というミッションを支援するものとして説明している[7]。また、Googleは医療分析用のMedGemmaなど、特定の用途に最適化された公式のGemma派生モデルを公開している[8]

歴史

各モデルの詳細については、#モデル一覧を参照。

Gemma (初代)

2024年2月21日米国時間[4][9]、GoogleはGeminiの軽量版として機能するフリーかつオープンソースなSLMファミリーであるGemmaを公式ブログ上で紹介した[4][9]。Gemma 2BとGemma 7Bの2つのサイズのモデルが公開され、パラメータ数はそれぞれ20億 (2B) と70億 (7B) である[3][4][9][10]

GoogleがオープンモデルのGemmaをリリースした際、複数のマスメディアは、MetaなどがAIモデルをオープンソース化していることへの対抗であり、Googleが長年AIを独自のものとして保持してきた方針からの劇的な転換であると報じた[11][12][13]

Gemma 2

2024年6月27日(米国時間)、Gemma 2(ジェマ ツー)がリリースされた[14][15]

同年10月3日には、Gemma 2 2Bの日本語版も公開された[16]

Gemma 3

2025年3月12日Gemma 3(ジェマ スリー)がリリースされた[17][18][5]

Gemma 3は、2億7000万、10億、40億、120億、270億 (270M, 1B, 4B, 12B, 27B) のパラメータサイズで公開され、140以上の言語をサポートしている。マルチモーダル英語版モデルとして、270Mと1Bはテキストのみ[19]、それ以外はテキストと画像の両方の入力に対応している[20]。さらに、Googleはスマートフォンノートパソコンタブレットなどのデバイスでの実行に最適化された小型モデルであるGemma 3nも公開している[21]

Gemma 3は、グループクエリアテンション (GQA: grouped-query attention) とSigLIPビジョンエンコーダを備えたデコーダのみのTransformerアーキテクチャに基づいている。4B、12B、27Bのコンテキスト長は128Kであるが、270M及び1Bのコンテキスト長は32Kである[22][23]

Gemma 3では、量子化対応トレーニング (QAT: quantization-aware training) を使用してファインチューニングされた量子化バージョンも利用可能である[23]。これはメモリ使用量を大幅に改善するが、精度と正確さ (precision) に多少の悪影響を及ぼす[24]

Google Deepmindは、Gemmaシリーズの初版公開から2025年5月11日(米国時間)までに、モデルのダウンロード数が1億5,000万回を超えたことを発表した[25][26]

また、Hugging Faceでは、コミュニティや個人によるファインチューニング版や量子化版を含め、7万以上のモデルが利用可能となった[26]

Gemma 4

2026年4月2日Gemma 4(ジェマ フォー)がリリースされた[2]

Gemma 4は、E2B、E4B、26B A4B、31Bのパラメータサイズで公開され、全モデルが画像と動画の入力に対応しており、E2BとE4Bはそれらに加えて音声の入力にも対応している[27]

公式派生モデル

Googleは、医療分析やプログラミングなど、特定の目的のために設計されたGemmaの公式派生モデルを開発している。

  • ShieldGemma 2 (4B) - Gemma 3ファミリーに基づく、暴力的、危険、および性的に露骨な画像を識別およびフィルタリングするためのモデル[28]
  • MedGemma (4Bおよび27B) - 同じくGemma 3に基づく、画像分析などの医療アプリケーション向けのモデル。しかし、GoogleはMedGemmaが「まだ臨床レベルではない」ともしている[29]インドグルグラムにあるTap Healthの開発者は、MedGemmaを使用してAI支援による糖尿病管理アプリケーションを強化している[30][31]
  • DolphinGemma (約400M) - ジョージア工科大学の研究者およびWild Dolphin Projectとの協力で開発された、音声分析を通じてイルカコミュニケーションをより良く理解することを目的としたモデル。モデルやデータは公開されていない[32][33]
  • CodeGemma (2Bおよび7B) - コード補完および一般的なコーディングのために設計されたモデル群[34]PythonJavaC++など、複数のプログラミング言語をサポートする[35]
  • TranslateGemma (4B、12B、27B) - Gemma 3をベースに、Geminiからの蒸留と強化学習でチューニングされた翻訳特化のモデル。パラメータ数がより多いGemma 3 27Bの翻訳性能を、TranslateGemma 12Bモデルは上回る。55言語を公式サポートしている[36]

モデル一覧

オープンウェイトモデルは、推論時にコンテキスト長を再スケーリングできる。Gemma 1、Gemma 2、PaliGemma、およびPaliGemma 2では、コスト(KVキャッシュのサイズ)は、コンテキスト長に比例して増加する。Gemma 3では、ローカルアテンションとグローバルアテンションの分離により、成長曲線が改善されている[23]。RecurrentGemmaでは、2048トークン後のメモリ使用量は変わらない[37]

さらに見る 世代, リリース日 ...
Gemmaモデルの技術仕様
世代 リリース日 パラメータ数 コンテキスト長 マルチモーダル 備考
Gemma 12024年2月21日2B, 7B8192非対応2Bモデルは7Bから蒸留 (distilled) されたもの。2Bはマルチクエリアテンションを使用し、7Bはマルチヘッドアテンションを使用。
CodeGemma2024年4月9日[38]2B, 7B8192非対応コード生成用にファインチューニングされたGemma 1。
RecurrentGemma2024年4月11日2B, 9B無制限(モデル学習時は8192トークン)  非対応Transformerベースではなく、Griffinベース[37]
Gemma 22024年6月27日2B, 9B, 27B  8192非対応27Bはウェブドキュメント、コード、科学論文から学習。Gemma 2 9Bは27Bから蒸留。Gemma 2 2Bは未リリースの7Bモデルから蒸留。グループクエリアテンション (Grouped-Query Attention) を使用[39]
PaliGemma2024年7月10日3B8192画像テキストと画像を入力として受け取り、テキストを出力する視覚言語モデル。SigLIP-So400m画像エンコーダとGemma v1.0 2Bを接続して作成[40][41]
PaliGemma 22024年12月4日3B, 10B, 28B8192画像SigLIP-So400mとGemma v2.0 2B、9B、および27Bを組み合わせて作成。より多くの視覚言語タスクが可能[42][43]
Gemma 32025年3月12日270M, 1B, 4B, 12B, 27B32K(270M / 1B) / 128K画像全モデルが蒸留により学習。事後学習は数学、コーディング、チャット、指示追従、多言語(140言語対応)に重点。関数呼び出しが可能。270M、1Bは視覚機能非対応[19][44][45]
Gemma 3n 2025年6月26日 E2B, E4B 32K 画像・音声 スマートフォン、ノートパソコン、タブレットなどのデバイスでの実行に最適化された小型モデル。Matryoshka Transformer(MatFormer)構造を採用。PLE(Per-Layer Embedding)キャッシュや条件付きパラメータ読み込みにより、メモリ使用量と計算コストを削減可能。[21]
TranslateGemma 2026年1月15日 4B, 12B, 27B 2K[46] 画像 Gemma 3をベースにGeminiからの蒸留(SFT/RL)で構築された翻訳特化モデル。55以上の主要・低リソース言語に対応。画像内のテキスト翻訳機能も保持している。[36]
Gemma 4 2026年4月2日 E2B, E4B, 26B A4B, 31B 128K(E2B/E4B) / 256K 画像・動画・音声(E2B/E4B) 推論(思考)モードを標準搭載したマルチモーダルモデル。動画はフレームとして処理。ハイブリッドアテンション(スライディングウィンドウ+グローバル)を採用。26B A4BはMoEモデル。E2B/E4Bのみ音声入力に対応。[27]
閉じる

脚注

関連項目

外部リンク

Related Articles

Timelines

Top Qs

Fact Checks