Inforlandia desenvolve nova plataforma de IA de elevado desempenho com 4× NVIDIA H200 NVL

A Inforlandia continua a reforçar a sua capacidade de desenvolvimento de infraestruturas de IA à medida, com a produção de uma nova plataforma de elevado desempenho, especialmente dimensionada para ambientes de investigação, desenvolvimento e utilização de modelos de Inteligência Artificial em produção.
Baseada em 4× NVIDIA H200 NVL, esta solução disponibiliza 564 GB de VRAM HBM3e, 503 GiB de memória DDR5 e capacidade para operar modelos de linguagem de grande dimensão com contextos até 128 K tokens.
A plataforma foi integralmente validada pela Inforlandia, desde o hardware à stack de software, permitindo assegurar o desempenho esperado em cenários de utilização com múltiplos utilizadores e cargas de trabalho de IA exigentes.

Uma plataforma desenvolvida para IA de elevada exigência

A nova solução tem como base um INSYS SM6-322GA (powered by Supermicro), configurado especificamente para maximizar a capacidade de processamento e memória disponível para workloads de Inteligência Artificial.
A configuração inclui:
  • 4× NVIDIA H200 NVL, com 141 GB de HBM3e por GPU;
  • 564 GB de VRAM total;
  • 2× Intel Xeon Gold 6530, com 64 núcleos / 128 threads;
  • 503 GiB de memória DDR5;
  • 3,5 TiB de armazenamento NVMe;
  • 2× 10 GbE + 2× NDR400 InfiniBand / 400 GbE;
  • 3× fontes de alimentação redundantes de 3200 W, com eficiência Titanium;
  • Gestão dedicada através de BMC/IPMI;
  • Ubuntu 22.04 LTS.
Esta combinação permite concentrar num único sistema uma elevada capacidade de computação GPU e memória, proporcionando uma plataforma preparada para modelos de IA de grande dimensão e para aplicações que exigem contexto longo.

LLM, imagem e vídeo numa única infraestrutura

Mais do que disponibilizar hardware de elevado desempenho, a Inforlandia validou uma stack completa de IA, baseada em Docker Compose sobre Ubuntu 22.04 LTS.
A plataforma integra:
  • vLLM, com API OpenAI para o modelo Qwen3.8-27B-FP8, utilizando as quatro GPUs em tensor parallel;
  • Open WebUI, para interação com os modelos através de uma interface web;
  • ComfyUI + FLUX, para geração e edição de imagens;
  • Cosmos3, para geração de vídeo.
O resultado é uma infraestrutura capaz de suportar LLM, geração de imagem e geração de vídeo no mesmo nó, sem necessidade de recorrer a sistemas independentes para cada workload.
Esta abordagem permite à Inforlandia desenvolver soluções adaptadas às necessidades concretas de cada organização, combinando hardware, software e configuração numa plataforma integrada.

Desempenho validado em cenários de utilização real

Os testes realizados com o modelo carregado em memória demonstraram a capacidade da plataforma para manter um elevado débito mesmo com vários utilizadores em simultâneo.
Num cenário com prompts de maior dimensão, foram atingidos:
  • 95 tok/s com 1 utilizador;
  • 237 tok/s com 4 utilizadores;
  • 431 tok/s com 8 utilizadores;
  • 561 tok/s com 16 utilizadores;
  • 628 tok/s agregados com 24 utilizadores simultâneos.
Com 24 utilizadores, o tempo até ao primeiro token (TTFT) foi de 363 ms.
Estes resultados demonstram a capacidade da plataforma para responder a ambientes em que a infraestrutura de IA é partilhada por vários utilizadores e aplicações, mantendo um elevado nível de desempenho.
A capacidade de memória disponível permite ainda trabalhar com 128 K tokens de contexto, sendo possível suportar aproximadamente 98 pedidos simultâneos a 128 K tokens com a capacidade de KV cache disponível.

IA on-premise para investigação e produção

O desenvolvimento desta plataforma responde a uma necessidade crescente de organizações que pretendem executar modelos de IA em infraestrutura própria, mantendo maior controlo sobre os dados, o ambiente de execução e a operação da plataforma.
Universidades, laboratórios, centros de investigação e outras organizações com necessidades avançadas de IA podem beneficiar de infraestruturas dimensionadas especificamente para os seus modelos, aplicações e níveis de utilização.
Com esta nova plataforma, a Inforlandia demonstra mais uma vez a sua capacidade para conceber, configurar e validar sistemas de computação de elevado desempenho orientados para aplicações específicas de Inteligência Artificial.

Uma infraestrutura pensada à medida da aplicação

Não existe uma configuração única que responda a todos os desafios de IA. O número e tipo de GPUs, a capacidade de memória, a rede, o armazenamento e a stack de software devem ser definidos em função dos modelos e workloads que a organização pretende executar.
É precisamente nesse processo de dimensionamento e desenvolvimento de soluções à medida que a experiência da Inforlandia permite transformar requisitos específicos numa infraestrutura de IA pronta para utilização.
Precisa de uma infraestrutura de IA dimensionada para investigação ou produção?
Fale com a Inforlandia através de depemp@inforlandia.pt ou do formulário de contacto disponível no site.

FAQ

Um servidor de IA é uma infraestrutura de computação dimensionada para executar aplicações e modelos de Inteligência Artificial, recorrendo normalmente a GPUs de elevado desempenho e elevada capacidade de memória.

Uma infraestrutura de IA on-premise permite executar modelos e aplicações de Inteligência Artificial na infraestrutura da própria organização, proporcionando maior controlo sobre o ambiente de execução, os dados e a operação.

A plataforma foi validada com uma stack que inclui vLLM, Open WebUI, ComfyUI + FLUX e Cosmos3, permitindo concentrar workloads de LLM, geração de imagem e geração de vídeo numa única infraestrutura.

Nos testes realizados, a plataforma atingiu 628 tokens por segundo agregados com 24 utilizadores simultâneos, utilizando o cenário de teste com prompts médios.

Sim. O posicionamento que esta página deve comunicar é precisamente a capacidade de dimensionar e configurar infraestruturas de IA de acordo com os modelos, aplicações e necessidades de cada organização.