ESEN
ESEN

Servidor para modelos abiertos

Servidor para modelos abiertos: los datos no salen de tu infraestructura

Un servidor cloud híbrido con 8 núcleos y 32 GB para correr modelos abiertos con Ollama o llama.cpp. Es un servidor de CPU: sirve para modelos chicos cuantizados, y preferimos decirlo antes de que contrates.

La respuesta corta

Se puede correr un modelo abierto —Hermes, Llama, Qwen— en un servidor propio con Ollama: se instala con un comando, se baja el modelo y queda atendiendo dentro del servidor, sin que el texto pase por una API de terceros. En SIS Argentina el SH6 (8 núcleos, 32 GB) corre cómodo modelos de 7B a 14B cuantizados. Sin GPU son unos pocos tokens por segundo y poca concurrencia: alcanza para clasificar, resumir o extraer datos de documentos, no para un chat de todo el equipo.

  • Ollama
  • llama.cpp
  • Hermes 3
  • Llama 3.1
  • Qwen3
  • Gemma 3
  • Mistral
  • DeepSeek-R1
  • GGUF
  • Ubuntu 24.04 LTS

Qué te da

El texto no sale del servidor

La inferencia corre en tu servidor: no hay clave de API ni pedido a un tercero. Lo único que sale a internet es la descarga del modelo, la primera vez.

Sin GPU, y se nota

La infraestructura es de CPU. Un modelo de 8B cuantizado responde a unos pocos tokens por segundo y aguanta pocos pedidos a la vez. Si tu caso pide GPU, escribinos y lo cotizamos.

Para qué alcanza

Clasificar texto, resumir, extraer datos de documentos, etiquetar registros y probar un modelo antes de decidir. Trabajos por lote, donde nadie está esperando la respuesta en pantalla.

Para qué no

Un chat para todo el equipo, respuestas instantáneas o modelos de 70B: eso pide GPU. Mejor saberlo ahora que después de contratar.

32 GB para el modelo y para el resto

El SH6 trae 8 núcleos y 32 GB, con RAID y disco de reserva: entra el modelo en memoria y queda lugar para la base de datos y la aplicación que lo consulta.

En el datacenter de Chacarita

El servidor está en nuestro datacenter propio TIER‑II, en la Ciudad de Buenos Aires, con infraestructura en Argentina desde 2003.

Planes para Servidor para modelos abiertos

Son los planes Servidores Cloud de siempre. Precios mensuales, IVA aparte. Los importes en dólares son la lista oficial de la tienda; la facturación local se emite en pesos.

SH1

Sin stock

$ 80.730/ mes

  • 4 x Intel Xeon
  • 4 Gb RAM
  • 240 Gb SSD ó 1 TB SAS
  • 1 IP fija pública
  • 99,8% de uptime de red
  • Transferencia no medida (uso razonable)
  • Windows o Linux
Consultar disponibilidad — SH1

SH2

$ 87.458/ mes

  • 4 x Intel Xeon
  • 6 Gb RAM
  • 240 Gb SSD ó 1 TB SAS
  • 1 IP fija pública
  • 99,8% de uptime de red
  • Transferencia no medida (uso razonable)
  • Windows o Linux
Contratar — SH2

SH3

$ 94.185/ mes

  • 4 x Intel Xeon
  • 8 Gb RAM
  • 240 Gb SSD ó 1 TB SAS
  • 1 IP fija pública
  • 99,8% de uptime de red
  • Transferencia no medida (uso razonable)
  • Windows o Linux
Contratar — SH3

SH4

$ 100.913/ mes

  • 8 x Intel Xeon
  • 8 Gb RAM
  • 240 Gb SSD ó 1 TB SAS
  • 1 IP fija pública
  • 99,8% de uptime de red
  • Transferencia no medida (uso razonable)
  • Windows o Linux
Contratar — SH4

SH5

$ 107.640/ mes

  • 8 x Intel Xeon
  • 16 Gb RAM
  • 240 Gb SSD ó 1 TB SAS
  • 1 IP fija pública
  • 99,8% de uptime de red
  • Transferencia no medida (uso razonable)
  • Windows o Linux
Contratar — SH5

El más elegido

SH6

$ 114.368/ mes

  • 8 x Intel Xeon
  • 32 Gb RAM
  • 240 Gb SSD ó 1 TB SAS
  • 1 IP fija pública
  • 99,8% de uptime de red
  • Transferencia no medida (uso razonable)
  • Windows o Linux
Contratar — SH6

Un modelo abierto andando en tres pasos

  1. Instalá Ollama

    El script oficial lo instala y lo deja registrado como servicio de systemd en Ubuntu 24.04:

    curl -fsSL https://ollama.com/install.sh | sh
  2. Bajá un modelo que entre

    Hermes 3 de 8B, de Nous Research, pesa 4,7 GB y entra sobrado en 32 GB. Probalo en el momento con ollama run hermes3:8b.

    ollama pull hermes3:8b
  3. Dejalo atendiendo solo adentro

    Queda escuchando en 127.0.0.1 y nada más. La API local de Ollama no pide usuario ni contraseña: no publiques el puerto 11434 en internet. Si lo consultás desde otra máquina, entrá por un túnel SSH: ssh -N -L 11434:127.0.0.1:11434 juan@203.0.113.24.

    mkdir -p /etc/systemd/system/ollama.service.d && printf '[Service]\nEnvironment="OLLAMA_HOST=127.0.0.1:11434"\n' > /etc/systemd/system/ollama.service.d/red.conf && systemctl daemon-reload && systemctl restart ollama

Para seguir: Servidor cloud o híbrido: qué hay detrás de cada nombre · Cuánta RAM necesita tu VPS

Preguntas frecuentes

¿Qué modelos entran en 32 GB?

Los de 7B a 14B cuantizados van cómodos: Hermes 3 de 8B pesa 4,7 GB de descarga. Los de 70B no: hermes3:70b son 40 GB, y aunque entraran, sin GPU no darían una velocidad usable.

¿Qué velocidad puedo esperar sin GPU?

Unos pocos tokens por segundo con un modelo de 8B cuantizado, y menos todavía si atiende varios pedidos a la vez. Para tareas por lote alcanza; para alguien esperando la respuesta del otro lado, no. Conviene medirlo con tu propio caso antes de comprometerse.

¿Tienen servidores con GPU?

No: la infraestructura es de CPU. Si tu caso necesita GPU, escribinos y lo cotizamos.

¿Puedo correr Hermes 4?

Los pesos de Hermes 4 están publicados en Hugging Face con licencia Apache 2.0. En la biblioteca oficial de Ollama lo que está es Hermes 3; para otros pesos, llama.cpp corre cualquier archivo GGUF que le des.

¿Los datos salen del servidor?

La inferencia es local: el texto que le mandás al modelo no sale del servidor. Lo único que sale a internet es la descarga del modelo, la primera vez, y las actualizaciones que decidas bajar.

¿Qué plan necesito?

Recomendamos el SH6: 8 núcleos y 32 GB, con RAID y disco de reserva. Si arrancás con uno más chico para probar, después se sube de plan sin migrar ni reinstalar.

Seguí por acá