SH1
Sin stock
$ 80.730/ mes
- 4 x Intel Xeon
- 4 Gb RAM
- 240 Gb SSD ó 1 TB SAS
- 1 IP fija pública
- 99,8% de uptime de red
- Transferencia no medida (uso razonable)
- Windows o Linux
Servidor para modelos abiertos
Un servidor cloud híbrido con 8 núcleos y 32 GB para correr modelos abiertos con Ollama o llama.cpp. Es un servidor de CPU: sirve para modelos chicos cuantizados, y preferimos decirlo antes de que contrates.
La respuesta corta
Se puede correr un modelo abierto —Hermes, Llama, Qwen— en un servidor propio con Ollama: se instala con un comando, se baja el modelo y queda atendiendo dentro del servidor, sin que el texto pase por una API de terceros. En SIS Argentina el SH6 (8 núcleos, 32 GB) corre cómodo modelos de 7B a 14B cuantizados. Sin GPU son unos pocos tokens por segundo y poca concurrencia: alcanza para clasificar, resumir o extraer datos de documentos, no para un chat de todo el equipo.
01
La inferencia corre en tu servidor: no hay clave de API ni pedido a un tercero. Lo único que sale a internet es la descarga del modelo, la primera vez.
02
La infraestructura es de CPU. Un modelo de 8B cuantizado responde a unos pocos tokens por segundo y aguanta pocos pedidos a la vez. Si tu caso pide GPU, escribinos y lo cotizamos.
03
Clasificar texto, resumir, extraer datos de documentos, etiquetar registros y probar un modelo antes de decidir. Trabajos por lote, donde nadie está esperando la respuesta en pantalla.
04
Un chat para todo el equipo, respuestas instantáneas o modelos de 70B: eso pide GPU. Mejor saberlo ahora que después de contratar.
05
El SH6 trae 8 núcleos y 32 GB, con RAID y disco de reserva: entra el modelo en memoria y queda lugar para la base de datos y la aplicación que lo consulta.
06
El servidor está en nuestro datacenter propio TIER‑II, en la Ciudad de Buenos Aires, con infraestructura en Argentina desde 2003.
Son los planes Servidores Cloud de siempre. Precios mensuales, IVA aparte. Los importes en dólares son la lista oficial de la tienda; la facturación local se emite en pesos.
Sin stock
$ 80.730/ mes
$ 87.458/ mes
$ 94.185/ mes
$ 100.913/ mes
$ 107.640/ mes
El más elegido
$ 114.368/ mes
El script oficial lo instala y lo deja registrado como servicio de systemd en Ubuntu 24.04:
curl -fsSL https://ollama.com/install.sh | shHermes 3 de 8B, de Nous Research, pesa 4,7 GB y entra sobrado en 32 GB. Probalo en el momento con ollama run hermes3:8b.
ollama pull hermes3:8bQueda escuchando en 127.0.0.1 y nada más. La API local de Ollama no pide usuario ni contraseña: no publiques el puerto 11434 en internet. Si lo consultás desde otra máquina, entrá por un túnel SSH: ssh -N -L 11434:127.0.0.1:11434 juan@203.0.113.24.
mkdir -p /etc/systemd/system/ollama.service.d && printf '[Service]\nEnvironment="OLLAMA_HOST=127.0.0.1:11434"\n' > /etc/systemd/system/ollama.service.d/red.conf && systemctl daemon-reload && systemctl restart ollamaPara seguir: Servidor cloud o híbrido: qué hay detrás de cada nombre · Cuánta RAM necesita tu VPS
Los de 7B a 14B cuantizados van cómodos: Hermes 3 de 8B pesa 4,7 GB de descarga. Los de 70B no: hermes3:70b son 40 GB, y aunque entraran, sin GPU no darían una velocidad usable.
Unos pocos tokens por segundo con un modelo de 8B cuantizado, y menos todavía si atiende varios pedidos a la vez. Para tareas por lote alcanza; para alguien esperando la respuesta del otro lado, no. Conviene medirlo con tu propio caso antes de comprometerse.
No: la infraestructura es de CPU. Si tu caso necesita GPU, escribinos y lo cotizamos.
Los pesos de Hermes 4 están publicados en Hugging Face con licencia Apache 2.0. En la biblioteca oficial de Ollama lo que está es Hermes 3; para otros pesos, llama.cpp corre cualquier archivo GGUF que le des.
La inferencia es local: el texto que le mandás al modelo no sale del servidor. Lo único que sale a internet es la descarga del modelo, la primera vez, y las actualizaciones que decidas bajar.
Recomendamos el SH6: 8 núcleos y 32 GB, con RAID y disco de reserva. Si arrancás con uno más chico para probar, después se sube de plan sin migrar ni reinstalar.