I modelli GLM-5.2 FP8, NVIDIA-Nemotron-Nano-12B-v2 e GLM-OCR sono ora disponibili su Amazon SageMaker JumpStart
I modelli GLM-5.2 FP8 di Z.ai, Nemotron-Nano-12B-v2 di NVIDIA e GLM-OCR di Z.ai sono ora disponibili su Amazon SageMaker JumpStart, ampliando il catalogo dei modelli di fondazione a disposizione dei clienti AWS. Questi tre modelli offrono funzionalità specializzate che spaziano dall'ingegneria agentica a lungo termine al ragionamento ibrido efficiente, fino alla comprensione avanzata dei documenti, consentendo ai clienti di distribuire soluzioni di IA scalabili e ad alte prestazioni sull'infrastruttura AWS.
GLM-5.2 FP8 è ottimizzato per attività a lungo termine e flussi di lavoro di ingegneria agentica, come lo sviluppo di software a ciclo completo, dalla definizione dei requisiti alla distribuzione. Il modello offre un notevole passo avanti nelle capacità di gestione delle attività a lungo termine rispetto al predecessore GLM-5.1 e, per la prima volta, mette a disposizione una finestra di contesto da 1 milione di token realmente utilizzabile, che consente di gestire contesti ingegneristici a livello di progetto, eseguire in modo affidabile attività di lunga durata, rispettare coerentemente gli standard di progettazione e completare interi flussi di lavoro di sviluppo in un'unica operazione.
NVIDIA-Nemotron-Nano-12B-v2 eccelle sia nelle attività di ragionamento unificato che in quelle standard con un elevato throughput di inferenza, risultando ideale per le applicazioni aziendali che richiedono precisione ed efficienza. Utilizza un'architettura ibrida Mamba-2 e Transformer con una lunghezza del contesto di 128K, in grado di generare percorsi di ragionamento prima di elaborare le risposte finali. Il design compatto da 12 miliardi di parametri permette di raggiungere un livello di precisione paragonabile o superiore a quello dei principali modelli aperti, offrendo al contempo un throughput di inferenza fino a 6 volte superiore.
GLM-OCR garantisce una comprensione dei documenti accurata, rapida e completa per materiali complessi del mondo reale, tra cui file PDF scansionati, note scritte a mano, articoli accademici densi di formule, tabelle a più colonne, documentazione di codice e testo multilingue. Questo modello multimodale da 0,9 miliardi di parametri ricostruisce la struttura, le tabelle e le formule in formati Markdown, JSON o LaTeX puliti, con livelli di latenza ridotti al minimo per l'impiego in servizi in tempo reale e dispositivi edge; la soluzione ideale per flussi di lavoro di estrazione dei dati da fatture ed elaborazione di documenti su larga scala.
SageMaker JumpStart consente ai clienti di distribuire uno qualsiasi di questi modelli con pochi clic per rispondere a specifici casi d'uso di IA.
Per iniziare, accedi al catalogo modelli di SageMaker JumpStart nella console SageMaker oppure utilizza l'SDK SageMaker Python per distribuire i modelli nell'account AWS. Per ulteriori informazioni sulla distribuzione e l'utilizzo dei modelli di fondazione in SageMaker JumpStart, consulta la documentazione di Amazon SageMaker JumpStart.