Um GPU Server é um servidor de inferência de modelos de linguagem (LLMs) e de embeddings mantido pela Embrapa e acessível, pela rede interna, a partir de determinados clusters da plataforma. As aplicações instanciadas nesses clusters consomem os modelos por APIs padronizadas: a API compatível com OpenAI (/v1) para chat, visão e tool calling, e a API nativa do Ollama (/api) para embeddings.
A lista abaixo é montada no momento do acesso a partir do catálogo oficial da plataforma. Para cada servidor são exibidos a arquitetura da GPU, a memória, os runtimes, os modelos publicados e os clusters a partir dos quais ele está disponível. Endereços completos, chaves e limites de uso são exibidos na dashboard ao configurar a build em um cluster que enxerga o servidor.
Carregando o catálogo…
Atenção! Os GPU Servers não são acessíveis pela Internet: só respondem a requisições originadas nos clusters indicados em cada item. Uma aplicação instanciada em outro cluster (ou fora da plataforma, via Releaser) não os alcança.