Saltar al contenido principal
Especialización Avanzada En vivo

Especialización C++ IA y HPC

Especialización avanzada en infraestructura de IA con C++. CUDA, ONNX Runtime, motores de inferencia, HPC y cómputo paralelo. Para programadores con base en C++.

Requiere: C++ Junior IA completado o experiencia equivalente en C++ con conocimientos básicos de álgebra lineal y sistemas concurrentes.
Solicitar información Ver temario completo
Temario

C++ Especialización IA y Alto Rendimiento — Programa completo

C++ para Infraestructura de IA, GPU Computing y Alto Rendimiento

El nivel que requieren los laboratorios de IA que eligen C++ sobre Python para producción
Requiere: C++ Junior IA completado o experiencia equivalente en C++ con conocimientos básicos de álgebra lineal y sistemas concurrentes.
  • Anatomía de un motor de inferencia: ONNX Runtime, TensorRT, OpenVINO y llama.cpp — arquitecturas comparadas.
  • ONNX Runtime avanzado: providers (CPU, CUDA, TensorRT, OpenVINO), sesiones, I/O bindings y optimización de grafos.
  • TensorRT: quantización INT8/FP16, calibración, plugins personalizados y perfiles de optimización.
  • OpenVINO: Intel Neural Network Compiler, IRs, heterogeneous execution y deployment en CPU/GPU Intel.
  • Kernel fusion: técnicas para fusionar operaciones y reducir overhead de memoria.
  • Quantization avanzada: PTQ, QAT, mixed precision. Impacto en accuracy vs latencia.
  • Memory planning: gestión eficiente de tensores, pooling de memoria y evitación de copias.
  • Benchmarking de motores de inferencia: MLPerf, latencia P99, throughput y métricas de producción.

Proyecto del módulo

Motor de inferencia personalizado en C++ que soporte múltiples backends (CPU/CUDA) con auto-selección, profiling integrado y API de C++ moderna.

  • Arquitectura GPU NVIDIA: SMs, warps, threads, shared memory, global memory y L2 cache. Modelo de ejecución.
  • CUDA C++: kernels, dim3, gestión de memoria (cudaMalloc, cudaMemcpy, managed memory, unified memory).
  • Optimización de kernels: coalesced memory access, shared memory tiling, warp divergence, occupancy.
  • Streams y concurrencia GPU: múltiples streams, eventos CUDA, overlap de compute y memoria.
  • Tensor Cores: wmma API, operaciones de matrices en FP16/BF16/INT8. cuBLAS y cuDNN avanzado.
  • Thrust: algoritmos paralelos de alto nivel. Custom iterators y fancy indexing.
  • CUDA Graph: captura y replay de grafos de kernels para overhead mínimo.
  • Multi-GPU: NCCL, peer-to-peer memory, NVLink. Patrones de data parallelism y model parallelism.

Proyecto del módulo

Implementación de un transformer attention kernel optimizado en CUDA con Tensor Cores. Benchmark comparativo contra cuDNN.

  • Arquitectura RAG de producción: indexado, retrieval, reranking y generation. Trade-offs de diseño.
  • Vector databases en C++: implementación de HNSW (Hierarchical Navigable Small World) desde cero.
  • Approximate Nearest Neighbor (ANN): FAISS con GPU, SCANN, y cuándo usar cada uno.
  • Embedding pipelines de alta velocidad: batching, caching, quantización de embeddings.
  • llama.cpp en profundidad: arquitectura, backends (CPU, CUDA, Metal, Vulkan), extensión con nuevas arquitecturas.
  • Serving de LLMs: vLLM internals, PagedAttention, continuous batching y KV cache management.
  • Speculative decoding: draft model + verification, implementación en C++.
  • Evaluación de RAG: métricas (faithfulness, relevance, groundedness), RAGAS framework.

Proyecto del módulo

Sistema RAG de producción en C++: indexado de documentos con embeddings cuantizados, HNSW para retrieval, reranking con cross-encoder ONNX y generación con llama.cpp. API gRPC incluida.

  • Optimización CPU avanzada: SIMD con intrinsics AVX-512, loop unrolling, prefetching y branch prediction hints.
  • Cache optimization avanzada: data-oriented design, struct of arrays vs array of structs, false sharing.
  • Lock-free programming: algoritmos lock-free, memoria ordering (std::memory_order), compare-and-swap.
  • MPI (Message Passing Interface): computación distribuida en C++. Colectivas, comunicación punto a punto.
  • OpenMP: paralelismo de memoria compartida. Tareas, SIMD, offloading a GPU.
  • SYCL/oneAPI: programación heterogénea portable (CPU + GPU + FPGA) con C++ estándar.
  • Network programming de alto rendimiento: RDMA, DPDK, kernel bypass y zero-copy.
  • Profiling avanzado: Intel VTune, NVIDIA Nsight Systems, perf + PAPI, flame graphs con BPF.

Proyecto del módulo

Sistema distribuido de entrenamiento distribuido de modelos pequeños: MPI + NCCL + gradient compression. Benchmark de scaling efficiency con múltiples "nodos" simulados.

  • Triton Inference Server: configuración, modelos ensemble, backends personalizados en C++, dynamic batching.
  • gRPC y Protocol Buffers en C++: APIs de alta performance para serving. Streaming bidireccional.
  • Kubernetes para ML serving: deployments, HPA basado en GPU utilization, node affinity.
  • Monitoring de producción: métricas de latencia/throughput con Prometheus, alertas y dashboards.
  • Continuous training pipelines: triggers de reentrenamiento, validación A/B de modelos, rollback automático.
  • Feature stores: diseño de feature stores para serving de baja latencia (Feast, Redis con C++ client).
  • Cost optimization: spot instances, auto-scaling, batching adaptativo y mixed precision en producción.
  • Regulación y AI Act: consideraciones de compliance para sistemas de IA de alto riesgo.

Proyecto del módulo

Pipeline MLOps completo: modelo ONNX → Triton server → cliente gRPC en C++ → monitoring Prometheus → CI/CD con validación automática de degradación de accuracy.

  • Portafolio para infraestructura de IA: proyectos que demuestran impacto medible (latencia, throughput, costo).
  • Entrevistas en empresas de IA: qué preguntan NVIDIA, Intel, Qualcomm, y startups de IA en LATAM.
  • Papers to code: cómo implementar papers de ML systems en C++ para publicar y ganar visibilidad.
  • Open source en ML systems: contribuciones a ONNX Runtime, llama.cpp, FAISS y Triton.
  • Precios y posicionamiento como consultor de infraestructura IA en México y LATAM.
  • Simulación de entrevista: system design de serving infrastructure, CUDA kernel code review.

Proyecto del módulo

Portafolio final publicado: NebulaDB v2.0 con GPU acceleration + motor de inferencia personalizado + sistema RAG de producción. Artículo técnico en Medium/Substack documentando las decisiones de diseño.

Nuestros fundadores

El equipo detrás de la academia

Profesionales con experiencia real en la industria tecnológica, comprometidos con hacer la programación accesible para todos.

Foto de Alfonso Quezada, Director Académico de Academia Techno Artist

Alfonso Quezada

Director Académico

Foto de Victor Ramberg, Director Comercial de Academia Techno Artist

Victor Ramberg

Director Comercial

¿Listo para empezar?

Inscríbete ahora

C++ Especialización IA y Alto Rendimiento

Clases en vivo · Grupos de máx. 10 · Certificación al egreso

SOLICITAR INFORMACIÓN ¿Tienes dudas? Escríbenos →