Ingeniero/a IA, 100% En remoto
hace 11 horas
Entendimiento profundo de gestión de contexto: qué entra en la ventana y por qué, compactación, memoria externa en filesystem, ordenación cache-aware. Experiencia sirviendo inferencia propia: vLLM, SGLang, TensorRT-LLM o similares batching continuo, cuantización, dimensionado de GPU y coste p