TEL-420 Sistemas Paralelos P5a taller slurm cluster · M5
M5 Guía de Práctica / Taller
Descargar .md

P5a · Taller de configuración y uso avanzado de Slurm en clúster de laboratorio

Contenido del programa: §20.5 · contenido 5.1 Horas de laboratorio: 4 · Modalidad: individual o parejas


1. Propósito

Capacitar en la gestión profesional de recursos de cómputo de alto rendimiento utilizando Slurm Workload Manager, dominando la creación de particiones lógicas, políticas de asignación justa (Fairshare), priorización de colas y el monitoreo de consumo de recursos en las estaciones Dell OptiPlex del laboratorio.


2. Fundamentación técnica

En centros de supercómputo y clústeres modernos, Slurm controla el acceso concurrente al hardware físico:

  • Particiones: Conjuntos lógicos de nodos con límites temporales y prioridades distintas (ej. partición debug para pruebas rápidas de máx. 10 minutos, partición batch para cálculos prolongados de hasta 48 horas).
  • Asignación de recursos: Control fino mediante directivas #SBATCH de CPU (--cpus-per-task), memoria (--mem), y aceleradores GPU (--gres=gpu:1).

3. Actividades guiadas

Ejercicio 1: Inspección de particiones y topología del clúster

  1. Ejecutar sinfo -o "%P %.5a %.10l %.6D %.6t %N" para visualizar particiones, estado de asignación de nodos y límites temporales.
  2. Identificar qué nodos están en estado idle, alloc o drain.

Ejercicio 2: Creación de un script sbatch con control de memoria y tiempo

Escribir un script job_slurm_hpc.sh que solicite:

  • 2 nodos virtuales.
  • 4 tareas MPI por nodo.
  • 2 GB de memoria RAM por nodo.
  • Límite estricto de tiempo de 5 minutos: #SBATCH --time=00:05:00.
  • Notificaciones de inicio y fin de trabajo.

Ejercicio 3: Simulación de contención y auditoría con sacct

  1. Encolar simultáneamente múltiples trabajos con sbatch para saturar los núcleos disponibles.
  2. Observar la cola con squeue verificando el paso de estados de pendiente (PD - Resources) a en ejecución (R).
  3. Auditar el trabajo terminado con sacct -j <JOBID> --format=JobID,JobName,Partition,AllocCPUS,Elapsed,State,MaxRSS para constatar el consumo máximo de memoria RAM física (Resident Set Size).

4. Entregables

Informe breve con capturas de sinfo, squeue y salida de sacct demostrando el ciclo de vida completo de un trabajo por lotes.