Test sobre Introducción a Apache Spark y Big Data
Introducción a Apache Spark y Big Data: Guía Completa
Test: Conceptos generales de Apache Spark, MapReduce, DataFrames y APIs de Apache Spark, Instalación y configuración de Apache Spark, Datos
20 preguntas
Pregunta 1: Spark Core es el paquete de Spark para trabajar con datos estructurados y permite mezclar consultas SQL con manipulación de datos programáticos compatibles con RDD.
A. Sí
B. No
Explicación: La descripción proporcionada en la pregunta corresponde a Spark SQL, que es el paquete de Spark para trabajar con datos estructurados y permite mezclar consultas SQL con manipulación de datos programáticos compatibles con RDD. Spark Core, por su parte, contiene la funcionalidad básica de Spark y alberga la API que define los RDD.
Pregunta 2: ¿Cuál de las siguientes opciones describe correctamente los tipos de algoritmos de aprendizaje automático que proporciona MLlib en Apache Spark, según los materiales de estudio?
A. Clasificación, regresión y la manipulación de datos en gráficos.
B. Agrupación en clúster, filtrado colaborativo y procesamiento de transmisiones de datos en vivo.
C. Clasificación, regresión, agrupación en clúster y filtrado colaborativo.
D. Solamente funciones de apoyo como la evaluación de modelos y la exportación de datos.
Explicación: Según los materiales de estudio, MLlib proporciona varios tipos de algoritmos de aprendizaje automático, incluida la clasificación, regresión, la agrupación en clúster y el filtrado colaborativo, además de funciones de apoyo. Las otras opciones incluyen funcionalidades de otros componentes de Spark como GraphX (manipulación de datos en gráficos) o Spark Streaming (procesamiento de transmisiones de datos en vivo), o son incompletas.
Pregunta 3: En la fase de shuffle y sorting de MapReduce, la clave de la salida del mapper se consolida y ordena.
A. Sí
B. No
Explicación: El material de estudio indica que en el proceso de Shuffle y Sorting, la clave de la salida del mapper se consolidará y ordenará.
Pregunta 4: ¿Cuáles son las tres fases principales en las que se ejecuta un trabajo de MapReduce, según la información proporcionada?
A. Map, Split y Output
B. Map, Shuffle and sorting y Reducer
C. JobTracker, TaskTracker y Mapper
D. Input, Processing y Consolidation
Explicación: El material de estudio indica que 'mapreduce se ejecuta en tres fases principales: Map, Shuffle and sorting phase, Reducer'.
Pregunta 5: Es posible aplicar funciones personalizadas directamente a un DataFrame de Spark de la misma manera que se hace en Pandas.
A. Sí
B. No
Explicación: La manipulación de datos en Spark es diferente a Pandas, y las funciones personalizadas no se pueden aplicar directamente a un DataFrame de Spark. Requiere un enfoque distinto porque un DataFrame de Spark está basado en RDDs.