Tarjetas de Introducción a Apache Spark y Big Data

Introducción a Apache Spark y Big Data: Guía Completa

1 / 11

¿Qué conjunto de datos se menciona para analizar casos de COVID-19 en Corea del Sur en esta lección?

La base de datos [NeurIPS 2020] Data Science for COVID-19 (DS4C) disponible en Kaggle.

Toca para girar · Desliza para navegar

Análisis de datos

11 tarjetas

Tarjeta 1

Pregunta: ¿Qué conjunto de datos se menciona para analizar casos de COVID-19 en Corea del Sur en esta lección?

Respuesta: La base de datos [NeurIPS 2020] Data Science for COVID-19 (DS4C) disponible en Kaggle.

Tarjeta 2

Pregunta: ¿Qué información contiene el archivo CSV llamado Case?

Respuesta: Contiene los casos reportados de contagio de COVID-19.

Tarjeta 3

Pregunta: ¿Qué información contiene el archivo CSV llamado PatientInfo?

Respuesta: Contiene la información de los pacientes.

Tarjeta 4

Pregunta: ¿Cuál es la tarea principal a realizar con el archivo Case según la consigna?

Respuesta: Determinar las tres ciudades con más casos confirmados de la enfermedad, y la salida debe tener columnas provincia, ciudad y casos confirmados con exa

Tarjeta 5

Pregunta: Al obtener las tres ciudades con más casos, ¿qué requisito estricto se indica sobre la salida?

Respuesta: La salida debe contener exactamente los tres nombres de ciudades con más casos confirmados; no se admiten otros valores.

Tarjeta 6

Pregunta: Al crear el dataframe desde PatientInfo, ¿qué requisito hay respecto a duplicados?

Respuesta: El dataframe debe asegurarse de que no contenga pacientes duplicados.

Tarjeta 7

Pregunta: ¿Qué pregunta específica se plantea sobre la columna infected_by en PatientInfo?

Respuesta: ¿Cuántos pacientes tienen informado por quién se contagiaron (columna infected_by)?

Tarjeta 8

Pregunta: Al filtrar pacientes que tengan valor en infected_by, ¿qué subselección adicional se solicita?

Respuesta: Obtener solo los pacientes femeninos dentro de los que tienen informado por quién se contagiaron.

Tarjeta 9

Pregunta: ¿Qué columnas deben eliminarse de la salida final del dataframe de pacientes femeninos infectados?

Respuesta: No debe contener las columnas released_date y deceased_date.

Tarjeta 10

Pregunta: ¿Cómo debe configurarse el número de particiones del dataframe resultante antes de escribirlo?

Respuesta: Establecer el número de particiones en dos.