Test sobre Introducción a Apache Spark y Big Data

Introducción a Apache Spark y Big Data: Guía Completa

Pregunta 1 de 50%

Spark Core es el paquete de Spark para trabajar con datos estructurados y permite mezclar consultas SQL con manipulación de datos programáticos compatibles con RDD.

Test: Conceptos generales de Apache Spark, MapReduce, DataFrames y APIs de Apache Spark, Instalación y configuración de Apache Spark, Datos

20 preguntas

Pregunta 1: Spark Core es el paquete de Spark para trabajar con datos estructurados y permite mezclar consultas SQL con manipulación de datos programáticos compatibles con RDD.

A.

B. No

Explicación: La descripción proporcionada en la pregunta corresponde a Spark SQL, que es el paquete de Spark para trabajar con datos estructurados y permite mezclar consultas SQL con manipulación de datos programáticos compatibles con RDD. Spark Core, por su parte, contiene la funcionalidad básica de Spark y alberga la API que define los RDD.

Pregunta 2: ¿Cuál de las siguientes opciones describe correctamente los tipos de algoritmos de aprendizaje automático que proporciona MLlib en Apache Spark, según los materiales de estudio?

A. Clasificación, regresión y la manipulación de datos en gráficos.

B. Agrupación en clúster, filtrado colaborativo y procesamiento de transmisiones de datos en vivo.

C. Clasificación, regresión, agrupación en clúster y filtrado colaborativo.

D. Solamente funciones de apoyo como la evaluación de modelos y la exportación de datos.

Explicación: Según los materiales de estudio, MLlib proporciona varios tipos de algoritmos de aprendizaje automático, incluida la clasificación, regresión, la agrupación en clúster y el filtrado colaborativo, además de funciones de apoyo. Las otras opciones incluyen funcionalidades de otros componentes de Spark como GraphX (manipulación de datos en gráficos) o Spark Streaming (procesamiento de transmisiones de datos en vivo), o son incompletas.

Pregunta 3: En la fase de shuffle y sorting de MapReduce, la clave de la salida del mapper se consolida y ordena.

A.

B. No

Explicación: El material de estudio indica que en el proceso de Shuffle y Sorting, la clave de la salida del mapper se consolidará y ordenará.

Pregunta 4: ¿Cuáles son las tres fases principales en las que se ejecuta un trabajo de MapReduce, según la información proporcionada?

A. Map, Split y Output

B. Map, Shuffle and sorting y Reducer

C. JobTracker, TaskTracker y Mapper

D. Input, Processing y Consolidation

Explicación: El material de estudio indica que 'mapreduce se ejecuta en tres fases principales: Map, Shuffle and sorting phase, Reducer'.

Pregunta 5: Es posible aplicar funciones personalizadas directamente a un DataFrame de Spark de la misma manera que se hace en Pandas.

A.

B. No

Explicación: La manipulación de datos en Spark es diferente a Pandas, y las funciones personalizadas no se pueden aplicar directamente a un DataFrame de Spark. Requiere un enfoque distinto porque un DataFrame de Spark está basado en RDDs.