Start Your Search Here

Job Search

GIELLE INFORMATICA S.R.L.

Milan / Global

AI Infrastructure Engineer

  • Remote

Job Description

Gielle Informatica Srl, società di consulenza informatica da oltre 40 anni, che vanta una lunga esperienza nella ricerca e nella selezione di personale ICT, ricerca per proprio cliente un/una AI Infrastructure Engineer Full remote

La risorsa sarà responsabile dell’ installazione, configurazione e gestione dell’infrastruttura Azure e on-premises per l’esecuzione di modelli Mistral e altri LLM , occupandosi di GPU server, Linux, Docker, Kubernetes, networking, security, Azure AI Foundry, model serving, vector database, monitoring, backup e automazione tramite Infrastructure as Code.

Competenze richieste Infrastructure Administration

Azure Infrastructure: subscriptions, resource groups, networking, subnets, NSGs, private endpoints, managed identities, RBAC e Azure Monitor;

Azure AI Foundry: configurazione di environments, endpoints, model connections, accessi, logging e monitoring;

GPU machines: selezione e configurazione di VM/server, gestione VRAM, NVIDIA drivers, CUDA, cuDNN e utilizzo GPU;

Linux: amministrazione avanzata, networking, storage, processi, permissions, systemd, troubleshooting e hardening;

Docker: creazione e gestione di container per modelli, API, vector database e monitoring tools;

Kubernetes: preferibilmente AKS e Kubernetes on-premises; deployment, Helm, ingress, secrets, autoscaling, persistent volumes e GPU scheduling;

Serving LLMs: installazione e gestione di strumenti quali vLLM, Hugging Face TGI, Ollama o framework equivalenti;

Mistral on-premises: download e gestione dei modelli, quantisation, inference configuration, updates, rollbacks e resource management;

Vector storage e database: Azure AI Search, pgvector, Qdrant, Milvus o tecnologie simili;

Infrastructure as Code: Terraform, Bicep o Ansible;

CI/CD: Azure DevOps per il deployment di infrastruttura, repository e configurazioni;

Monitoring e logging: metriche GPU e CPU, memory, latency, throughput, errors, queues, token usage e service availability;

Backup e Disaster Recovery: recovery procedures, redundancy, data management e regular testing.

Security È richiesta esperienza nella gestione di:

Secrets tramite Azure Key Vault o sistemi equivalenti;

TLS certificates e key management;

Identities, roles e principio del least privilege ;

Network segmentation;

Private access ai servizi Azure;

Hardening dei server Linux;

Scanning delle Docker images;

Patching e aggiornamento dei componenti;

Auditing e access logging;

Protezione di documenti e prompt contenenti dati confidenziali.

Attività Il candidato dovrà essere in grado di:

Configurare da zero un GPU server on-premises ;

Configurare NVIDIA drivers, CUDA e container runtimes;

Eseguire Mistral tramite un inference server ;

Esporre il modello tramite API sicure;

Installare e configurare un vector database;

Configurare ambienti separati di development, testing e production;

Monitorare performance e availability;

Effettuare troubleshooting e supportare gli utenti;

Diagnosticare problematiche relative a GPU memory, latency, networking e storage;

Automatizzare il provisioning tramite Terraform, Bicep o Ansible;

Definire procedure di updates, rollbacks e disaster recovery.

Certificazioni Costituiscono titolo preferenziale:

AZ-104 – Azure Administrator

AI-300 – Machine Learning Operations Engineering Associate

Tipologia di collaborazione: Partita IVA

Tariffa: sarà concordata in base all esperienza e competenze del candidato.

Ai sensi del D.Lgs. 196/03 e dell art. 13 del GDPR (Regolamento UE 2016/679), i candidati sono invitati a prendere visione dell informativa sul trattamento dei dati personali.

La ricerca è rivolta a candidati di entrambi i sessi (L.903/77 e L.125/91), nonché a persone di tutte le età e nazionalità, ai sensi dei D.Lgs. 215/03 e 216/03.

#J-18808-Ljbffr

Applica Now

Similar Opportunities

View all jobs