モデルはメモリに収まる?
モデルの規模と精度を変更します。容量と速度は異なる問いに答えます。
ISEGORIA / シリコンのガイド / 2020–2026
M1からM6までのApple Mシリーズ。内部構造を見て、系譜を比べ、処理の限界を探ります。
01 / アーキテクチャ探索
チップを選び、ブロックを選択してください。ダイの配置図は、公開されたダイ写真や注釈付きフロアプランがあればその位置に、なければ最も近い世代に倣ってブロックを置き、どちらに基づくかを示します。シリコンの質感は写真ではなく描画です。ほかの表示は機能を示す模式図で、小さな四角は1コアを表し、位置は実際の配置ではありません。
図のルール:ブロックの位置・大きさ、キャッシュ境界、配線経路は説明用です。コア総数と公表ダイ構成は事実に基づきますが、M5の各ダイ内の実配置は示していません。メモリの帯は共通のプールを表し、ダイ内DRAMを意味しません。
02 / 進化の2つの軸
共通の尺度で公表最大値を比較します。これは仕様の比較で、ベンチマーク点数ではありません。
メモリ容量は各チップの歴史上の公表最大値です。下位構成ではコア数や帯域幅が異なります。引用したM1発表資料には正確な帯域幅がないため省略しています。M3 Ultraの当初の最大512 GBと後の販売構成は異なります。
03 / 制約を探る実験室
モデルの規模と精度を変更します。容量と速度は異なる問いに答えます。
仮想的な同一性能の処理主体でアムダールの法則を確認します。Appleチップの性能モデルではありません。
P十億個のパラメータを1重みqビットで格納する密なモデルでは、重みだけで約P × q / 8 GB(十進単位)を要します。実際には量子化メタデータ、実行時データ、活性、KVキャッシュ、OSの領域も必要です。この実験では、搭載メモリ全体を空き容量とせず、予約領域を明示して調整します。
非常に単純化したバッチ1のデコードモデルとして、1トークン生成ごとに有効な重みを1回読むと仮定します。帯域幅だけによる上限は、帯域幅を重みサイズで割った値です。演算、注意機構、キャッシュへのアクセス、フレームワークの負荷を除外した教材用の上限であり、実測の生成速度ではありません。MoEでは有効重みの数え方が必要で、バッチ処理では再利用が変わります。
例:80億個の重みを4ビットで保存すると、付加領域を除いて4 GBです。100 GB/sなら単純モデルの上限は25トークン/秒ですが、実機の予測値ではありません。
アムダールの法則では、直列部分の割合sと並列化できる部分を分けます。同じ速度の理想的なN個の処理主体による高速化は1 / (s + (1 − s) / N)です。20%が直列なら、処理主体を無限に増やしても5倍を超えません。実際にはスケジューリング、コア性能差、メモリ競合も影響します。
この実験は仮想的な同一性能の処理主体を使い、Appleのコアに架空の性能点数を割り当てません。並列化の性質を説明するもので、M1とM6の順位付けではありません。単一スレッド性能、専用演算、冷却余裕、アルゴリズムの改善は別の効果です。
例:直列部分が20%なら、8個で3.33倍、16個で4倍です。処理主体を倍増しても、速度の向上は20%にとどまります。
端末、メモリ構成、電力モード、アプリ、演算精度、モデル、処理内容を確認します。短い負荷と長時間のレンダリングでは条件が異なります。同じチップでも、ファンレス端末と能動冷却の端末では時間とともに差が出る場合があります。
Appleの「最大」の比較は指定条件での結果であり、普遍的な比率ではありません。異なる試験の比率を連結したり、精度が異なるTOPSを同一視したり、コア数を総合性能点数へ変換したりしないでください。このアトラスが描くのは仕様であり、架空の性能順位ではありません。
更新は制約に合わせて考えます。収まらない処理には容量、連続データ処理には帯域幅、対応描画にはGPU機能、直列処理にはCPUの遅延、対応コーデックにはメディアエンジンが重要です。アプリと端末全体を確認しましょう。
04 / 系譜を読む
M1はCPU、GPU、Neural Engine、各種コントローラをMac向けの統合システムにまとめました。4つの高性能コアと4つの高効率コアは、ほかのエンジンと共通のメモリを使います。統合の利点は演算だけでなく、データ移動の削減にもあります。
2021年のProとMaxは処理資源を拡張し、2022年のUltraは2つのMaxダイを接続しました。M1 ProとM1 Maxの最大CPUコア数は同じですが、Maxの最大GPUコア数とメモリ帯域幅は2倍です。上位モデルでも全機能が一律に倍増するわけではありません。
M1 ProとM1 Maxを比較すると、CPUは10コアのまま、GPUは16から32コアになります。
[1] [2] [3]M2は5 nm世代を改良しました。標準モデルのCPUは8コアのまま、GPUは最大10コア、ユニファイドメモリは24 GB、帯域幅は100 GB/sへ拡大しました。ProRes専用ハードウェアも標準モデルに加わりました。
M2 ProとMaxは最大12 CPUコアへ拡張し、M2 Ultraは2つのMaxダイを接続しました。Ultraの公表最大メモリ容量192 GBにより、メモリ内で扱える処理が広がりました。大容量化は実行可能性を変えますが、小さな処理の遅延を必ず短縮するものではありません。
M2 MaxとM2 Ultraを比較し、資源の倍増をアプリが活用できる条件を考えてみましょう。
[4] [5] [6]Mシリーズ初の3 nm世代は、Dynamic Caching、ハードウェアレイトレーシング、メッシュシェーディングを導入しました。単なるコア数の増加ではなく、GPUができることの変化です。AV1のハードウェアデコードも加わりました。
すべての仕様が世代ごとに増えるわけではありません。M3 Proの帯域幅は150 GB/sで、M2 Proの200 GB/sを下回ります。M3 UltraはM4より後の2025年に登場し、最大32 CPUコア、80 GPUコアを搭載しました。当初の公表最大メモリは512 GBですが、後の販売構成は異なる場合があります。
M2 ProとM3 Proを比較すると、新しいGPU機能と帯域幅の減少を同時に確認できます。
[7] [8] [14] [15]M4はiPad Proで初登場し、その後Macに搭載されました。第2世代3 nmプロセスとともにCPU、GPU、Neural Engineを改良しています。Macでの公表最大容量はM4が32 GB、Proが64 GB、Maxが128 GBです。すべての端末がこの容量を備えるわけではありません。
M4 ProとMaxはMacでThunderbolt 5に対応し、帯域幅は273 GB/sと最大546 GB/sへ増えました。ただし32 GPUコア版M4 Maxは410 GB/sです。この確認済み一覧にM4 Ultraはありません。各世代ですべての階層がそろうとは限りません。
M4とM3 Ultraを比べると、新しい標準チップと以前の大規模デスクトップ向けチップの役割の違いが分かります。
[9] [10] [15]M5は各GPUコアにNeural Acceleratorを追加しました。これはNeural Engineとは別の演算器です。対応ソフトウェアを通じて利用する必要があり、すべてのAIアプリが一律に高速化するわけではありません。標準M5の帯域幅は153 GB/sです。
ProとMaxは2ダイのFusion Architectureを採用し、最大6つのスーパーコアと12の高性能コアを備えます。M5 Ultraは2ダイ構成のMaxを2つ接続し、計4ダイ、最大36 CPUコアと80 GPUコアになります。Appleの公表値は最大512 GB、帯域幅1.2 TB/sです。物理的な接続とソフトウェアからの見え方は別の問題です。
M5 MaxとM5 Ultraを比較し、図のGPUとメモリを切り替えて、拡張される部分を確認しましょう。
[11] [12] [13]2026年8月25日発表のM6は、Appleの2 nmプロセス世代を導入しました。12コアCPUは2つのスーパーコア、4つの高性能コア、6つの高効率コアで構成されます。GPUはNeural Accelerator付きの12コアで、Neural Engineは16コアを2基搭載します。
標準チップの公表最大値は32 GBと170 GB/sです。数百GBを必要とする用途でUltraを置き換えられることを意味しません。掲載するのは発表済みの標準M6のみで、Pro、Max、Ultraの未確認仕様は作成していません。
M6とM5 Ultraを選ぶと、世代の新しさと処理規模が異なる軸であることが分かります。
[13]05 / さらに学ぶ
PDFには全仕様一覧、アーキテクチャ図、世代解説、実験の説明、出典を収録しています。図は独自制作の模式図で、ベンチマークや実ダイ配置の測定結果ではありません。
対象:2026年9月19日までに発表されたMシリーズSoC。Aシリーズと旧Mシリーズのモーションコプロセッサは対象外です。英語版と日本語版は共通データを使用します。