Tutorial
t-SNE en R: visualización de datos de alta dimensionalidad
Este tutorial muestra cómo aplicar t-SNE en R para proyectar datos multivariables en dos dimensiones
y detectar estructuras, grupos y relaciones locales. Está pensado para personas que trabajan con
datos ómicos, clínicos o de machine learning y necesitan una visualización exploratoria robusta.
Descripción
t-SNE (t-distributed Stochastic Neighbor Embedding) permite reducir dimensionalidad preservando vecindades locales, por lo que es ideal para explorar patrones no lineales.
En esta guía se cubre la preparación de datos, la selección de hiperparámetros clave y la visualización final para interpretar resultados con criterio.
Requisitos previos
- Conocimientos básicos de R y manejo de data frames.
- Datos numéricos escalables o matriz de características.
- Paquetes de visualización en R, por ejemplo ggplot2.
Pasos clave
- Limpieza y estandarización de variables.
- Definición de parámetros como perplexity y learning rate.
- Ejecución de t-SNE y evaluación de estabilidad.
- Visualización de clusters y lectura biológica o clínica.
Código de ejemplo
Ejemplo minimo de flujo en R para correr t-SNE sobre una matriz de datos.
# Instalacion (si hace falta)
# install.packages(c("Rtsne", "ggplot2"))
library(Rtsne)
library(ggplot2)
set.seed(123)
X <- scale(iris[, 1:4])
fit <- Rtsne(X, dims = 2, perplexity = 30, verbose = FALSE)
plot_df <- data.frame(
TSNE1 = fit$Y[, 1],
TSNE2 = fit$Y[, 2],
Species = iris$Species
)
ggplot(plot_df, aes(TSNE1, TSNE2, color = Species)) +
geom_point(size = 2.4, alpha = 0.9) +
theme_minimal(base_size = 12)
Nota metodológica
t-SNE es excelente para exploración visual, pero no debe interpretarse como prueba inferencial.
Conviene repetir análisis con distintas semillas y comparar con métodos complementarios como PCA o UMAP.