SparkContext
Contexto captura
Fecha: 2026-09-10 Origen:
= this.origenTipo:= this.tipo-captura
📝 Captura principal
Lo más importante
SparkContextrepresenta la conexión de bajo nivel entre una aplicación y el cluster de Spark. Sigue siendo importante, pero normalmente no se crea directamente en aplicaciones modernas de PySpark.
🎯 Detalles / Contenido
SparkContext coordina la ejecución distribuida y permite a la aplicación comunicarse con el cluster. Es la base de APIs de bajo nivel como los RDDs.
Actualmente, el punto de entrada recomendado es SparkSession. Al crear una sesión, Spark crea o reutiliza un SparkContext internamente:
from pyspark.sql import SparkSession
spark = SparkSession.builder.appName("Ejemplo").getOrCreate()
sc = spark.sparkContextEn este caso, sc permite acceder al contexto que ya utiliza la sesión. No es necesario crear otro SparkContext.
La creación directa puede encontrarse en código antiguo o en ejemplos que trabajan específicamente con RDDs:
from pyspark import SparkConf, SparkContext
conf = SparkConf().setAppName("Ejemplo RDD")
sc = SparkContext(conf=conf)Para trabajar con DataFrames, SQL y las funciones habituales de PySpark, se debe preferir SparkSession. Crear varios SparkContext activos en el mismo proceso puede provocar errores; normalmente solo debe existir uno.
🔑 Keywords / Conceptos clave
SparkContext, SparkSession, RDD, cluster, driver, spark.sparkContext
Para RAG
SparkContext es el componente de bajo nivel que conecta la aplicación con el cluster. SparkSession lo crea o reutiliza internamente y es la interfaz recomendada para trabajar con DataFrames y SQL.
🎴 Flashcards
¿Qué es SparkContext?::El componente de bajo nivel que conecta una aplicación PySpark con el cluster y coordina la ejecución distribuida. card
¿Cómo se accede normalmente a SparkContext en PySpark moderno?::A través de spark.sparkContext, después de crear una SparkSession. card
¿Se debe crear un SparkContext para cada DataFrame?::No. Normalmente se crea o reutiliza uno mediante SparkSession. card
❓ Preguntas / Dudas pendientes
- ¿Qué operaciones de RDD requieren usar directamente
SparkContext? - Para operaciones de bajo nivel como consultar o crear parelelismo, crear y transformar RDD’s
- ¿Qué diferencia hay entre un RDD y un DataFrame?
- La estructura, un RDD es menos estructurado que un dataframe con columnas y filas definidas y además el redimiento de un dataframe es mayor.
🧩 Conexiones potenciales
- SparkSession - Es una versión más actual de SparkContext para manipular dataframes.
✅ Checklist procesamiento
- Revisar y expandir contenido
- Crear flashcards si es necesario
- Hacer un ejercicio accediendo a
spark.sparkContext - Conectar con otras notas
- Actualizar nivel de comprensión
💭 Notas adicionales / Ideas rápidas
No es una API obsoleta, pero sí una abstracción más baja que normalmente no necesitas manipular directamente al empezar con DataFrames.
Tags: big-data spark pyspark spark-context captura-rapida
🧪 Aplicación
- Explicarlo sin consultar la nota ✅ 2026-09-21
- Resolver un caso nuevo o escribir un ejemplo
- Compararlo con una alternativa ✅ 2026-09-21
- Usarlo en un proyecto
🔗 Conexiones explicadas
🚧 Plan de Mejora / Tareas Pendientes
Define las tareas que te ayudarán a subir tu nivel-comprension en la próxima revisión. Usa los tags: #mejora-concepto, #mejora-practica, #mejora-analogia.
- Tarea para aclarar una duda de concepto. Usa mejora-concepto
- Tarea para implementar un ejercicio práctico. Usa mejora-practica
- Tarea para crear una analogía o diagrama. Usa mejora-analogia