Test sobre Fundamentos de Apache Spark y Big Data

Fundamentos de Apache Spark y Big Data: Guía Completa para Estudiantes

Pregunta 1 de 50%

En la fase de MapReduce, la salida del proceso Shuffle consiste en pares clave-valor listos para ser guardados directamente en HDFS.

Test: Apache Spark, MapReduce, Pandas, DataFrames, Análisis de datos, Herramientas de Big Data

20 preguntas

Pregunta 1: En la fase de MapReduce, la salida del proceso Shuffle consiste en pares clave-valor listos para ser guardados directamente en HDFS.

A.

B. No

Explicación: La salida de la fase Shuffle y sorting es un mapa <clave, Lista<lista de valores>>, que se utiliza como entrada para la fase Reducer. No se guarda directamente en HDFS; el resultado final se consolida en la fase Reducer y luego se guarda en HDFS.

Pregunta 2: En la arquitectura de MapReduce, ¿cuál de las siguientes afirmaciones describe correctamente la función del JobTracker y el TaskTracker?

A. El JobTracker es el proceso maestro que gestiona y sigue los recursos, mientras que el TaskTracker es su proceso esclavo que informa sobre el estado de las tareas.

B. El TaskTracker es responsable de la coordinación general de la operación MapReduce, enviando mensajes al JobTracker cada 3 segundos.

C. El JobTracker envía mensajes al TaskTracker cada 3 segundos para solicitar el estado de las tareas y los slots disponibles.

D. El TaskTracker informa al JobTracker sobre los slots disponibles y el chequeo de performance, siendo un proceso esclavo.

Explicación: El JobTracker es el proceso maestro responsable de la coordinación y completitud de la operación MapReduce, y su principal función es gestionar y trackear los recursos. El TaskTracker es un proceso esclavo del JobTracker que le envía mensajes cada 3 segundos, informándole sobre los slots disponibles, el estado de las tareas y el chequeo de performance.

Pregunta 3: Los archivos de datos pequeños son preferibles para trabajar con Pandas y aprovechar su versatilidad.

A.

B. No

Explicación: Si los archivos a trabajar son pequeños, es preferible utilizar Pandas y aprovechar toda su versatilidad.

Pregunta 4: Según el material de estudio, ¿cuál es la razón principal por la que se prefiere trabajar con Pandas al manipular archivos de datos pequeños?

A. Para aprovechar su máxima capacidad de registros, que supera los límites de Spark.

B. Para obtener un mejor rendimiento en sistemas de archivos distribuidos.

C. Para aprovechar toda su versatilidad.

D. Debido a que está construido sobre la JVM y se basa en Scala.

Explicación: El material de estudio indica claramente que 'si los archivos son pequeños, es preferible trabajar con pandas y aprovechar toda su versatilidad'.

Pregunta 5: Los DataFrames en PySpark permiten acceder a una fila específica mediante su posición utilizando el comando "iloc", al igual que en Pandas.

A.

B. No

Explicación: Los materiales de estudio indican que la característica de acceder a una fila específica mediante su posición con el comando "iloc" es una particularidad de los DataFrames de Pandas, no de PySpark.