Resumen de Detección Temprana de CVD con Redes Neuronales
Detección Temprana de ECV con Redes Neuronales: Estudio en Perú
Introducción
Las redes neuronales son modelos computacionales inspirados en la estructura y funcionamiento del cerebro humano. Se usan para aproximar funciones complejas, reconocer patrones y resolver problemas en áreas como visión por computadora, procesamiento de lenguaje natural y control. En este material repasaremos la teoría básica, arquitecturas principales, entrenamiento, regularización y ejemplos prácticos, sin abordar aplicaciones específicas relacionadas con la detección cardiovascular o su uso clínico.
¿Qué es una neurona artificial?
Una neurona artificial es una unidad computacional que recibe entradas, las pondera, aplica una suma y una función de activación para producir una salida.
- Entrada: $x_1$, $x_2$, ..., $x_n$
- Pesos: $w_1$, $w_2$, ..., $w_n$
- Sesgo (bias): $b$
- Operación: salida $y = \phi\left(\sum_{i=1}^{n} w_i x_i + b\right)$
Definición: La función de activación $\phi$ introduce no linealidad permitiendo a la red aproximar funciones no lineales.
Funciones de activación comunes
- Lineal: $\phi(z)=z$ (uso limitado a capas intermedias cuando se necesita salida continua)
- Sigmoide: $\phi(z)=\frac{1}{1+e^{-z}}$
- Tangente hiperbólica: $\phi(z)=\tanh(z)$
- ReLU: $\phi(z)=\max(0,z)$
- Leaky ReLU: $\phi(z)=\max(\alpha z,z)$ para $\alpha>0$
Arquitectura de redes neuronales
Perceptrón simple
- Útil para problemas linealmente separables
- Ecuación de decisión: $y=\operatorname{sign}\left(\sum_{i} w_i x_i + b\right)$
Redes neuronales multicapa (MLP)
- Capas: entrada, una o varias ocultas, salida
- Cada capa calcula: $\mathbf{h}^{(l)} = \phi\left( W^{(l)} \mathbf{h}^{(l-1)} + \mathbf{b}^{(l)} \right)$
- Capacidad para aproximar funciones arbitrarias si la red tiene suficiente tamaño (Teorema de aproximación universal)
Definición: Teorema de aproximación universal: una red feedforward con una sola capa oculta y funciones de activación no lineales puede aproximar cualquier función continua en un conjunto compacto, dada una cantidad suficiente de neuronas.
Redes profundas
- Múltiples capas ocultas permiten aprender representaciones jerárquicas
- Ventaja: extracción automática de características de alto nivel
- Riesgo: sobreajuste y problemas de entrenamiento (desvanecimiento/explosión de gradiente)
Entrenamiento: Propagación hacia atrás y optimización
- Forward pass: calcular la salida predicha para una entrada
- Función de pérdida: medir el error, por ejemplo, pérdida cuadrática media (MSE) o entropía cruzada
- MSE: $\mathcal{L}=\frac{1}{m}\sum_{i=1}^{m} (y_i-\hat{y}_i)^2$
- Entropía cruzada (binaria): $\mathcal{L}=-\frac{1}{m}\sum_{i=1}^{m} \left[ y_i \log(\hat{y}_i) + (1-y_i)\log(1-\hat{y}_i) \right]$
- Backpropagation: calcular gradientes $\frac{\partial \mathcal{L}}{\partial w}$ mediante la regla de la cadena
- Actualización de pesos con optimizadores: SGD, Momentum, Adam, RMSprop
- Actualización SGD básica: $w \leftarrow w - \eta \frac{\partial \mathcal{L}}{\partial w}$ donde $\eta$ es la tasa de aprendizaje
Definición: Backpropagation es el algoritmo que propaga el error desde la salida hacia las capas anteriores para obtener los gradientes necesarios en la optimización.
Ajuste de hiperparámetros
- Tasa de aprendizaje $\eta$
- Tamaño del lote (batch size)
- Número de épocas
- Arquitectura: número de capas y neuronas
- Funciones de activación
Regularización y técnicas para evitar el sobreajuste
- Early stopping: detener el entrenamiento cuando la pérdida de validación deja de mejorar
- Dropout: apagar aleatoriamente neuronas durante el entrenamiento con probabilidad $p$
- L1 y L2 (regularización por norma): agregar términos $\lambda |w|_1$ o $\lambda |w|_2^2$ a la pérdida
- Batch normalization: normalizar activaciones dentro de cada mini-batch para estabilizar y
¿Ya tienes cuenta? Iniciar sesión
Redes neuronales: Fundamentos
Klíčové pojmy: Una neurona artificial calcula $y = \phi\left(\sum_{i=1}^{n} w_i x_i + b\right)$, Funciones de activación clave: sigmoide, tanh, ReLU, Leaky ReLU, MLP con una capa oculta puede aproximar cualquier función continua (teorema de aproximación universal), Entrenamiento: forward pass, pérdida, backpropagation, optimización (SGD, Adam), Regularización esencial: early stopping, dropout, L1, L2, batch normalization, Inicializaciones: Xavier para tanh/sigmoide, He para ReLU, Arquitecturas: CNN para imágenes, RNN/LSTM para secuencias, transformadores para atención, Evaluación: usar métricas adecuadas y validación cruzada, Preprocesamiento y división de datos son pasos críticos antes del entrenamiento, Limitaciones: necesidad de datos, interpretabilidad y consumo computacional