Il collo di bottiglia dell'addestramento dei modelli di raccomandazione non è la potenza di calcolo in virgola mobile, ma la velocità con cui i dati viaggiano tra gli acceleratori. Meta risolve questo problema strutturale con MTIA 300, il primo chip della famiglia in-house progettato specificamente per il training di modelli ranking e raccomandazione, dove le tabelle di embedding possono costituire oltre il 99% dei parametri totali.

Aggiungi AlexTech.ai comeFonte Preferita su Google

La rete integrata nel package del chip

A differenza delle architetture GPU tradizionali, dove l'interfaccia di rete compete per risorse con i kernel di calcolo o richiede la mediazione della CPU, MTIA 300 integra due chiplet di rete direttamente nel package. Questi contengono dodici NIC RDMA custom da 800 Gbps ciascuna, per un totale di 1,2 TB/s di banda I/O che non attraversa mai il bus PCIe. Questa configurazione elimina l'overhead host-device-NIC e permette di partizionare dinamicamente la banda tra scale-up (fino a 1 TB/s all'interno di un rack) e scale-out (200 GB/s tra i rack).

Comunicazione come cittadino di prima classe

All You Need to Know About Meta’s New AI Chip MTIA — https://encord.com/blog/meta-ai-chip-mtia-explained/

Il cuore dell'innovazione risiede nei 16 message engine (ME) dedicati, dotati di core RISC-V e blocchi near-memory compute. Questi gestiscono autonomamente le operazioni collettive (AllReduce, AllToAll) senza toccare la griglia di calcolo a 12x6 PEs. Il risultato è un'isolazione quasi perfetta: l'esecuzione simultanea di GEMM e collettivi introduce una degradazione inferiore allo 0,5% del throughput di calcolo, contro il 20%+ tipico delle GPU. La libreria HCCL compila le operazioni in subgraph eseguiti in modo autonomo dal dispositivo, liberando la CPU dopo l'iniziale dispatch.

Prestazioni in produzione e roadmap

Meta MTIA 300 | Awesome Agents — https://awesomeagents.ai/hardware/meta-mtia-300/

Su un modello di raccomandazione da 150 miliardi di parametri distribuito su 40 acceleratori, MTIA 300 raggiunge una velocità di comunicazione 3,9 volte superiore rispetto a un cluster GPU equivalente. La memoria HBM3E da 216 GB consente batch locali più grandi, riducendo la necessità di comunicazione. Meta indica che i principi architetturali di MTIA 300 e HCCL, presentati nei paper ISCA '26 e SC26, sono la base per le generazioni future di silicio AI dell'azienda.

Il contesto strategico

Questo lancio si inserisce in una strategia più ampia di indipendenza hardware. Come riportato da AlexTech, Meta ha investito 6,5 miliardi di dollari con Samsung Foundry per la produzione a 2nm. Il chip MTIA 300 affianca il progetto Iris e si colloca nel trend più ampio di chip AI custom che sta ridisegnando il mercato dell'infrastruttura AI.