class: center, middle, titular background-size: contain <img src="img/see.png" width="250px"/> # Sección 7: Análisis Exploratorio de Datos - Extra ## **PROGRAMA INTERNACIONAL DE ESTADÍSTICA APLICADA A LA INVESTIGACIÓN CIENTÍFICA** #### MÓDULO: SOFTWARES PARA EL MANEJO DE DATOS <br> <br> Linda Cabrera Orellana #### Marzo, 2023 --- class: middle, center, inverse
# Diagrama de Violin --- #
Diagrama de Violin .pull-left[ Un diagrama de violín se utiliza para visualizar la distribución de los datos y su densidad de probabilidad y se obtiene con `geom_violin()`. Este gráfico es una combinación de un diagrama de cajas y bigotes y un diagrama de densidad girado y colocado a cada lado, para mostrar la forma de distribución de los datos. Los diagramas de cajas y bigotes están limitados a su visualización de los datos, ya que su simplicidad visual tiende a ocultar detalles significativos sobre cómo se distribuyen los valores en los datos. Adicionalmente puedes encontrar más gráficos en el paquete [ggstatsplot](https://indrajeetpatil.github.io/ggstatsplot/) que sirve para crear gráficos con detalles de pruebas estadísticas incluidas en los propios gráficos ricos en información. ] .pull-right[ <img src="img/violin.png" width="600px"/> ] --- #
Diagrama de Violin .pull-left[ ```r ## gráfico de cajas y diagrama de violin profesores %>% ggplot(aes(x = nivel, y = salario, fill = nivel)) + geom_boxplot(alpha = 0.3) + geom_violin(alpha = 0.5, color = NA) + scale_fill_manual(values = paleta_simpson) + labs(x = "Nivel en que imparte docencia", y = "Salario del profesor", title = "Salario de Profesores por el Nivel de docencia", subtitle = "Gráfico de Cajas y Diagrma de Violin") + theme_pander() + theme(legend.position = "none") ``` ] .pull-right[ <!-- --> ] --- class: middle, center, inverse
# Gráfico de Pastel --- #
Gráfico de Pastel .pull-left[ Una gráfica de pastel es un tipo de representación que tiene la forma de un disco dividido en sectores, cuyas áreas son proporcionales a los porcentajes de los distintos componentes de la población estadística. Cada valor del carácter estudiado corresponde a un sector o categoría de una variable categórica. Las medidas de los ángulos de los sectores son proporcionales a los números representados (o a las frecuencias asociadas). La representación de números negativos es imposible con este tipo de diagrama. Los gráficos circulares son una buena forma de mostrar gráficamente una distribución de frecuencias. En un gráfico circular, la frecuencia o el porcentaje se representa tanto visual como numéricamente, por lo que suele ser rápida de entender para los lectores. ] .pull-right[ <img src="img/pastel.png" width="500px"/> ] --- #
Gráfico de Pastel .pull-left[ Para hacer un gráfico de pastel necesitamos `geom_bar()` y un `coord_polar()` y trabajar con datos resumidos con `group_by()` y `summarise()`: ```r ## resumimos datos como en el gráfico de columnas profesores %>% group_by(nivel) %>% summarise(frecuencia = n()) %>% mutate(proporcion = round(frecuencia/ sum(frecuencia),3)*100 ) %>% view() # gráfico de pastel simple con geom_bar() y coord_polar() profesores %>% group_by(nivel) %>% summarise(frecuencia = n()) %>% mutate(proporcion = round(frecuencia/ sum(frecuencia),3)*100 ) %>% ggplot(aes(x = "", y = proporcion, fill = nivel)) + geom_bar(stat = "identity", color="white") + scale_fill_manual(values = paleta_simpson) + coord_polar("y", start = 0) ``` ] .pull-right[ <!-- --> ] --- #
Gráfico de Pastel .pull-left[ ```r # crear etiquetas para el gráfico de pastel profesores %>% group_by(nivel) %>% summarise(frecuencia = n()) %>% arrange(-frecuencia) %>% mutate(proporcion = round(frecuencia/ sum(frecuencia),3), posicionLabel = cumsum(proporcion) - 0.5*proporcion) %>% view() ## agregar etiquetas profesores %>% group_by(nivel) %>% summarise(frecuencia = n()) %>% arrange(-frecuencia) %>% mutate(proporcion = round(frecuencia/ sum(frecuencia),3), posicionLabel = cumsum(proporcion) - 0.5*proporcion) %>% ggplot(aes(x = "", y = proporcion, fill = reorder(nivel, frecuencia))) + geom_bar(stat = "identity", color="white") + scale_fill_manual(values = paleta_simpson) + coord_polar("y", start = 0) + geom_text(aes(y = posicionLabel, label = scales::percent(proporcion)), color = "white", size = 4) ``` ] .pull-right[ <!-- --> ] --- #
Gráfico de Pastel .pull-left[ ```r ## mejorar temas, colores, formato profesores %>% group_by(nivel) %>% summarise(frecuencia = n()) %>% arrange(-frecuencia) %>% mutate(proporcion = round(frecuencia/ sum(frecuencia),3), posicionLabel = cumsum(proporcion) - 0.5*proporcion) %>% ggplot(aes(x = "", y = proporcion, fill = reorder(nivel, frecuencia))) + geom_bar(stat = "identity", color="white") + scale_fill_manual(values = paleta_simpson) + coord_polar("y", start = 0) + geom_text(aes(y = posicionLabel, label = scales::percent(proporcion)), color = "white", size = 4) + labs(x = " ", y = " ", title = "Cantidad de encuestados por nivel de docencia", subtitle = "Gráfico de Pastel", fill = "Nivel de docencia") + theme_pander() + theme(panel.grid.minor = element_blank(), panel.grid.major = element_blank(), axis.text.x = element_blank()) ``` ] .pull-right[ <!-- --> ] --- class: middle, center, inverse
# Lollipop --- #
Lollipop .pull-left[ Una variante común de los gráficos de columnas son los gráficos lollipop. La principal diferencia es que la forma de la columna es reemplazada por una línea terminada en punto. Esto permite que visualmente esté menos saturado y sea más claro comparar los valores en los entremos. En R podemos conseguir un gráfico lollipop con un gráfico de puntos `geom_point()` y un gráfico de segmento `geom_segment()`. ] .pull-right[ <img src="img/lollipop.jpg" width="500px"/> ] --- #
Lollipop .pull-left[ ```r profesores %>% group_by(asistente) %>% summarise(frecuencia = n()) %>% ggplot(aes(x = asistente, y = frecuencia, fill = asistente, color = asistente)) + geom_point(size = 5) + geom_segment(aes(xend = asistente, y = 0, yend = frecuencia), linewidth = 1) + scale_fill_manual(values = paleta_simpson) + scale_color_manual(values = paleta_simpson) + labs(x = " ", y = "Frecuencia", title = "Cantidad de encuestados por preferencia de Asistente de Clases") + theme_pander() + theme(legend.position = "none") ``` ] .pull-right[ <!-- --> ] --- class: middle, center, inverse
# Gráfico de Cascada --- #
Gráfico de Cascada .pull-left[ El gráfico en cascada también denominado gráfico puente, es un tipo especial de gráfico de columnas que le ayuda a identificar cómo un valor inicial se ve afectado por un aumento y una disminución de los datos intermedios, lo que lleva a un valor final. En R podemos conseguir un gráfico de cascada con la librería `waterfalls` y la función `waterfall()`. ] .pull-right[ <img src="img/cascada.png" width="500px"/> ] --- #
Gráfico de Cascada .pull-left[ ```r library(waterfalls) profesores %>% group_by(asistente) %>% summarise(frecuencia = n()) %>% arrange(-frecuencia) %>% mutate(proporcion = round(frecuencia/ sum(frecuencia),3)) %>% waterfall(values = proporcion, calc_total = TRUE, fill_by_sign = FALSE, fill_colours = c("#FED439", "#709AE1", "#FD7446", "#197EC0", "#46732E"), total_rect_color = "#D5E4A2", rect_border = NA, total_rect_border_color = NA) + labs(x = " ", y = " ", title = "Cantidad de transacciones por pregunta de Asistente", fill = "Provincia") + theme_pander() ``` ] .pull-right[ <!-- --> ] --- class: middle, center, inverse <br> <br> # Análisis Exploratorio de Datos - Extra ### Linda Cabrera Orellana .pull-left[ .center[ ### [@socecuest
](https://www.facebook.com/socecuest) ### [@see_estadistica
](https://www.instagram.com/see_estadistica/) ]] .pull-right[ .center[ ### [@see_estadistica
](https://twitter.com/see_estadistica) ### [@sosecuest
](https://t.me/sosecuest) ]]