Resumen de Detección Temprana de CVD con Redes Neuronales

Detección Temprana de ECV con Redes Neuronales: Estudio en Perú

Introducción

Las redes neuronales son modelos computacionales inspirados en la estructura y funcionamiento del cerebro humano. Se usan para aproximar funciones complejas, reconocer patrones y resolver problemas en áreas como visión por computadora, procesamiento de lenguaje natural y control. En este material repasaremos la teoría básica, arquitecturas principales, entrenamiento, regularización y ejemplos prácticos, sin abordar aplicaciones específicas relacionadas con la detección cardiovascular o su uso clínico.

¿Qué es una neurona artificial?

Una neurona artificial es una unidad computacional que recibe entradas, las pondera, aplica una suma y una función de activación para producir una salida.

  • Entrada: $x_1$, $x_2$, ..., $x_n$
  • Pesos: $w_1$, $w_2$, ..., $w_n$
  • Sesgo (bias): $b$
  • Operación: salida $y = \phi\left(\sum_{i=1}^{n} w_i x_i + b\right)$

Definición: La función de activación $\phi$ introduce no linealidad permitiendo a la red aproximar funciones no lineales.

Funciones de activación comunes

  • Lineal: $\phi(z)=z$ (uso limitado a capas intermedias cuando se necesita salida continua)
  • Sigmoide: $\phi(z)=\frac{1}{1+e^{-z}}$
  • Tangente hiperbólica: $\phi(z)=\tanh(z)$
  • ReLU: $\phi(z)=\max(0,z)$
  • Leaky ReLU: $\phi(z)=\max(\alpha z,z)$ para $\alpha>0$
💡 Věděli jste?Fun fact: ¿Sabías que la función ReLU acelera la convergencia del entrenamiento en redes profundas al reducir el problema del desvanecimiento del gradiente en muchas capas?

Arquitectura de redes neuronales

Perceptrón simple

  • Útil para problemas linealmente separables
  • Ecuación de decisión: $y=\operatorname{sign}\left(\sum_{i} w_i x_i + b\right)$

Redes neuronales multicapa (MLP)

  • Capas: entrada, una o varias ocultas, salida
  • Cada capa calcula: $\mathbf{h}^{(l)} = \phi\left( W^{(l)} \mathbf{h}^{(l-1)} + \mathbf{b}^{(l)} \right)$
  • Capacidad para aproximar funciones arbitrarias si la red tiene suficiente tamaño (Teorema de aproximación universal)

Definición: Teorema de aproximación universal: una red feedforward con una sola capa oculta y funciones de activación no lineales puede aproximar cualquier función continua en un conjunto compacto, dada una cantidad suficiente de neuronas.

Redes profundas

  • Múltiples capas ocultas permiten aprender representaciones jerárquicas
  • Ventaja: extracción automática de características de alto nivel
  • Riesgo: sobreajuste y problemas de entrenamiento (desvanecimiento/explosión de gradiente)

Entrenamiento: Propagación hacia atrás y optimización

  1. Forward pass: calcular la salida predicha para una entrada
  2. Función de pérdida: medir el error, por ejemplo, pérdida cuadrática media (MSE) o entropía cruzada
    • MSE: $\mathcal{L}=\frac{1}{m}\sum_{i=1}^{m} (y_i-\hat{y}_i)^2$
    • Entropía cruzada (binaria): $\mathcal{L}=-\frac{1}{m}\sum_{i=1}^{m} \left[ y_i \log(\hat{y}_i) + (1-y_i)\log(1-\hat{y}_i) \right]$
  3. Backpropagation: calcular gradientes $\frac{\partial \mathcal{L}}{\partial w}$ mediante la regla de la cadena
  4. Actualización de pesos con optimizadores: SGD, Momentum, Adam, RMSprop
    • Actualización SGD básica: $w \leftarrow w - \eta \frac{\partial \mathcal{L}}{\partial w}$ donde $\eta$ es la tasa de aprendizaje

Definición: Backpropagation es el algoritmo que propaga el error desde la salida hacia las capas anteriores para obtener los gradientes necesarios en la optimización.

Ajuste de hiperparámetros

  • Tasa de aprendizaje $\eta$
  • Tamaño del lote (batch size)
  • Número de épocas
  • Arquitectura: número de capas y neuronas
  • Funciones de activación

Regularización y técnicas para evitar el sobreajuste

  • Early stopping: detener el entrenamiento cuando la pérdida de validación deja de mejorar
  • Dropout: apagar aleatoriamente neuronas durante el entrenamiento con probabilidad $p$
  • L1 y L2 (regularización por norma): agregar términos $\lambda |w|_1$ o $\lambda |w|_2^2$ a la pérdida
  • Batch normalization: normalizar activaciones dentro de cada mini-batch para estabilizar y
Zaregistruj se pro celé shrnutí
TarjetasTest de conocimientosResumenPodcastMapa mental
Empezar gratis

¿Ya tienes cuenta? Iniciar sesión

Redes neuronales: Fundamentos

Klíčové pojmy: Una neurona artificial calcula $y = \phi\left(\sum_{i=1}^{n} w_i x_i + b\right)$, Funciones de activación clave: sigmoide, tanh, ReLU, Leaky ReLU, MLP con una capa oculta puede aproximar cualquier función continua (teorema de aproximación universal), Entrenamiento: forward pass, pérdida, backpropagation, optimización (SGD, Adam), Regularización esencial: early stopping, dropout, L1, L2, batch normalization, Inicializaciones: Xavier para tanh/sigmoide, He para ReLU, Arquitecturas: CNN para imágenes, RNN/LSTM para secuencias, transformadores para atención, Evaluación: usar métricas adecuadas y validación cruzada, Preprocesamiento y división de datos son pasos críticos antes del entrenamiento, Limitaciones: necesidad de datos, interpretabilidad y consumo computacional

## Introducción Las **redes neuronales** son modelos computacionales inspirados en la estructura y funcionamiento del cerebro humano. Se usan para aproximar funciones complejas, reconocer patrones y resolver problemas en áreas como visión por computadora, procesamiento de lenguaje natural y control. En este material repasaremos la teoría básica, arquitecturas principales, entrenamiento, regularización y ejemplos prácticos, sin abordar aplicaciones específicas relacionadas con la detección cardiovascular o su uso clínico. ## ¿Qué es una neurona artificial? > Una neurona artificial es una unidad computacional que recibe entradas, las pondera, aplica una suma y una función de activación para producir una salida. - Entrada: $x_1$, $x_2$, ..., $x_n$ - Pesos: $w_1$, $w_2$, ..., $w_n$ - Sesgo (bias): $b$ - Operación: salida $y = \phi\left(\sum_{i=1}^{n} w_i x_i + b\right)$ > Definición: La función de activación $\phi$ introduce no linealidad permitiendo a la red aproximar funciones no lineales. ### Funciones de activación comunes - Lineal: $\phi(z)=z$ (uso limitado a capas intermedias cuando se necesita salida continua) - Sigmoide: $\phi(z)=\frac{1}{1+e^{-z}}$ - Tangente hiperbólica: $\phi(z)=\tanh(z)$ - ReLU: $\phi(z)=\max(0,z)$ - Leaky ReLU: $\phi(z)=\max(\alpha z,z)$ para $\alpha>0$ Fun fact: ¿Sabías que la función ReLU acelera la convergencia del entrenamiento en redes profundas al reducir el problema del desvanecimiento del gradiente en muchas capas? ## Arquitectura de redes neuronales ### Perceptrón simple - Útil para problemas linealmente separables - Ecuación de decisión: $y=\operatorname{sign}\left(\sum_{i} w_i x_i + b\right)$ ### Redes neuronales multicapa (MLP) - Capas: entrada, una o varias ocultas, salida - Cada capa calcula: $\mathbf{h}^{(l)} = \phi\left( W^{(l)} \mathbf{h}^{(l-1)} + \mathbf{b}^{(l)} \right)$ - Capacidad para aproximar funciones arbitrarias si la red tiene suficiente tamaño (Teorema de aproximación universal) > Definición: Teorema de aproximación universal: una red feedforward con una sola capa oculta y funciones de activación no lineales puede aproximar cualquier función continua en un conjunto compacto, dada una cantidad suficiente de neuronas. ### Redes profundas - Múltiples capas ocultas permiten aprender representaciones jerárquicas - Ventaja: extracción automática de características de alto nivel - Riesgo: sobreajuste y problemas de entrenamiento (desvanecimiento/explosión de gradiente) ## Entrenamiento: Propagación hacia atrás y optimización 1. Forward pass: calcular la salida predicha para una entrada 2. Función de pérdida: medir el error, por ejemplo, pérdida cuadrática media (MSE) o entropía cruzada - MSE: $\mathcal{L}=\frac{1}{m}\sum_{i=1}^{m} (y_i-\hat{y}_i)^2$ - Entropía cruzada (binaria): $\mathcal{L}=-\frac{1}{m}\sum_{i=1}^{m} \left[ y_i \log(\hat{y}_i) + (1-y_i)\log(1-\hat{y}_i) \right]$ 3. Backpropagation: calcular gradientes $\frac{\partial \mathcal{L}}{\partial w}$ mediante la regla de la cadena 4. Actualización de pesos con optimizadores: SGD, Momentum, Adam, RMSprop - Actualización SGD básica: $w \leftarrow w - \eta \frac{\partial \mathcal{L}}{\partial w}$ donde $\eta$ es la tasa de aprendizaje > Definición: Backpropagation es el algoritmo que propaga el error desde la salida hacia las capas anteriores para obtener los gradientes necesarios en la optimización. ### Ajuste de hiperparámetros - Tasa de aprendizaje $\eta$ - Tamaño del lote (batch size) - Número de épocas - Arquitectura: número de capas y neuronas - Funciones de activación ## Regularización y técnicas para evitar el sobreajuste - Early stopping: detener el entrenamiento cuando la pérdida de validación deja de mejorar - Dropout: apagar aleatoriamente neuronas durante el entrenamiento con probabilidad $p$ - L1 y L2 (regularización por norma): agregar términos $\lambda \|w\|_1$ o $\lambda \|w\|_2^2$ a la pérdida - Batch normalization: normalizar activaciones dentro de cada mini-batch para estabilizar y