Área de investigación
Análisis
19 publicaciones en el archivo.
Agentes y Tool Use: Arquitectura ReAct y Function Calling
Análisis de la arquitectura de agentes autónomos basada en el paradigma ReAct y la capacidad de Function Calling Se examina la formalización matemática del bucle de razonamiento-acción y la implementación de esquemas JSON para la ejecución determinista de herramientas.
RLVR: Optimización de Modelos de Lenguaje mediante Recompensas Verificables
Análisis de la transición de RLHF a RLVR (Reinforcement Learning with Verifiable Rewards) para tareas de razonamiento complejo. Se examina la formulación matemática de funciones de recompensa, la implementación de entornos de verificación de código/matemáticas y el impacto en la precisión técnica.
Chain of Thought (CoT): Mecanismos de inferencia y tokens de razonamiento oculto
Análisis técnico de Chain of Thought (CoT) y la integración de tokens de pensamiento en el proceso de inferencia. Se examina la formulación probabilística de pasos intermedios, el impacto en la latencia de inferencia y la transición de CoT vía prompting a arquitecturas con razonamiento latente.
Mixture of Experts: Sparse Activation y Estrategias de Routing en LLMs
Análisis de la arquitectura Mixture of Experts (MoE), enfocado en el desacople del coste de inferencia respecto al conteo total de parámetros mediante "conditional computation".
Post-Training Quantization en LLMs: Reducción de Precisión de FP16 a INT4
Análisis técnico de estrategias de Post-Training Quantization (PTQ) para LLM, enfocándose en la transición de FP16 a INT4. Se examinan los fundamentos de la cuantización, el impacto en la perplejidad del modelo y la reducción de latencia.
Fine-Tuning Strategies: SFT y Low-Rank Adaptation (LoRA) en LLMs
Análisis técnico de la adaptación de Large Language Models (LLMs) mediante Supervised Fine-Tuning (SFT) y Parameter-Efficient Fine-Tuning (PEFT). Implementación de LoRA para la reducción de requerimientos de VRAM y preservación de pesos pre-entrenados frente al catastrophic forgetting.
KV Cache: Optimización de Latencia y Memoria en Transformers Autoregresivos
Análisis técnico del mecanismo de Key-Value (KV) Cache en la inferencia de Large Language Models (LLMs). Se detalla la reducción de FLOPs redundantes durante la decodificación autoregresiva, el impacto en el consumo de VRAM y las implicaciones de ancho de banda.
RAG (Retrieval-Augmented Generation): Arquitectura, Indexación Vectorial y Generación Contextual
Análisis de la arquitectura RAG para sistemas de QA sobre datos propietarios. Se aborda la integración de dense retrieval mediante bases de datos vectoriales, la formulación probabilística de la generación condicionada y la implementación técnica para mitigar alucinaciones en LLMs.
RLHF: Optimización de Modelos de Lenguaje mediante Preferencias Humanas
Análisis técnico del pipeline de alineación propuesto en InstructGPT (Ouyang et al., 2022). Se detalla la implementación de Reward Models, la optimización mediante Proximal Policy Optimization (PPO) y el impacto en la reducción de toxicidad frente al pre-entrenamiento estándar.
Context Window en Transformers: Complejidad Cuadrática y Limitaciones de Memoria
Análisis técnico de la ventana de contexto en arquitecturas Transformer y la barrera de la complejidad computacional. Evaluación del consumo de memoria VRAM en función de la longitud de secuencia.
Transformer Architecture: Análisis Comparativo de Encoder y Decoder Stacks
Desglose técnico de la arquitectura Transformer (Vaswani et al., 2017) y su bifurcación en modelos Encoder-only (BERT) y Decoder-only (GPT). Análisis del mecanismo Scaled Dot-Product Attention, implementación de máscaras de causalidad y evaluación de complejidad computacional.
Mecanismo de Self-Attention: Formulación Matemática y Arquitectura Transformer
Análisis del mecanismo de Scaled Dot-Product Attention propuesto en "Attention Is All You Need". Se detalla el cálculo de matrices Key-Query-Value, la eliminación de la recurrencia para paralelización masiva y el impacto en la complejidad computacional respecto a la longitud de la secuencia.
Vector Embeddings: Espacios Latentes y Similitud Coseno
Análisis de la representación de variables categóricas en espacios vectoriales continuos mediante modelos de distribución como Word2Vec y GloVe.
Arquitecturas Recurrentes: Dinámica, Vanishing Gradients y Gating Mechanisms
Análisis técnico de redes neuronales recurrentes (RNN), LSTM y GRU para el modelado de datos secuenciales.
MobileNet: Depthwise Separable Convolutions y Eficiencia Computacional
Análisis de la arquitectura MobileNet (Howard et al., 2017) centrado en la descomposición de la convolución estándar mediante Depthwise Separable Convolutions.
Neural Machine Translation with Subword Units: BPE y gestión de vocabulario
Análisis del algoritmo Byte Pair Encoding (BPE). Se examina la reducción del problema de palabras fuera de vocabulario (OOV), la optimización del tamaño de la matriz de embeddings y el balance entre eficiencia computacional y representatividad morfológica.
Optimización Numérica en Redes Neuronales: Loss Functions y Stochastic Gradient Descent
Análisis técnico de la minimización del error en modelos supervisados mediante funciones de pérdida. Se aborda la formulación matemática de Cross-Entropy, la mecánica de Gradient Descent y su implementación vectorizada en Python para garantizar convergencia en superficies no convexas.
CNN Architectures: Evolución de Profundidad y Feature Extraction
Análisis técnico de la transición desde filtros manuales a aprendizaje jerárquico profundo. Evaluación del impacto de la profundidad en AlexNet, VGG y la reciente introducción de Residual Learning (ResNet) en ILSVRC 2015.
Arquitecturas Densas (MLP): Fundamentos Matemáticos y Propagación
Análisis de la arquitectura del Perceptrón Multicapa (MLP) como aproximador universal de funciones. Se aborda la formulación matricial del forward pass, el rol crítico de las funciones de activación no lineales y la dinámica de optimización.