Cuando una oferta de Data Engineer pide "experiencia en GCP", casi nunca se refiere a Google Cloud en general: se refiere a un puñado concreto de servicios — BigQuery, Dataflow, Pub/Sub, Dataproc y Cloud Composer — que juntos arman el pipeline estándar de datos en esa nube. Si sabes para qué sirve cada uno y cómo se conectan, ya puedes defenderte en una entrevista técnica sin haber tocado el resto del catálogo de GCP.
BigQuery: el motor de análisis, no una base de datos más
BigQuery es un data warehouse serverless: no administras servidores ni clusters, pagas por los datos que escaneas en cada consulta. Esa diferencia cambia cómo diseñas las tablas — particionar por fecha y usar clustering en las columnas que más filtras no es opcional, es lo que evita que una consulta de prueba te cueste como si hubieras escaneado toda la tabla histórica. He visto equipos recibir una factura sorpresa solo por hacer SELECT * en una tabla de varios terabytes sin filtro de fecha.
Este es justo el stack que cubre el Bootcamp de Google Cloud Platform Data Engineer de DataPath en vivo: 8 sesiones donde pasas de los fundamentos de cloud computing a tener un pipeline batch y otro en streaming corriendo en tu propia cuenta de GCP.
Dataproc vs. Dataflow: por qué GCP tiene dos formas de procesar datos
Esta es la pregunta que más se repite en entrevistas, y la respuesta corta es: Dataproc es Spark y Hadoop administrados (lo usas si tu equipo ya tiene código PySpark y no quiere reescribirlo), y Dataflow es Apache Beam nativo de Google, pensado para pipelines que necesitan correr igual en batch y en streaming sin tocar el código. Si estás empezando un proyecto desde cero y no cargas con Spark heredado, Dataflow suele ser la opción más simple de mantener a largo plazo.
La trampa típica: migrar un pipeline de Dataproc a Dataflow pensando que es un simple cambio de proveedor. No lo es. Beam tiene su propio modelo de programación (PCollections, transforms) y reescribir un job de PySpark a Beam suele tomar más tiempo del que cualquier estimación inicial calcula.
El resto del stack, en orden de cuándo lo usas
- ▸Cloud Storage — el data lake: aquí aterriza todo antes de transformarse
- ▸Dataproc o Dataflow — la capa de procesamiento y transformación
- ▸BigQuery — el destino final para análisis y los dashboards que consumen el negocio
- ▸Cloud Composer (Airflow administrado) — orquesta cuándo corre cada paso y qué hacer si algo falla
- ▸Pub/Sub — la cola de mensajería para todo lo que llega en tiempo real, no en lotes
Un caso típico: de evento a dashboard en minutos
Un evento de un sensor o de una app llega a Pub/Sub, un job de Dataflow lo lee, lo limpia y lo agrega en ventanas de tiempo, y el resultado cae en una tabla de BigQuery particionada por hora. Cloud Composer no interviene aquí porque el streaming corre solo; donde sí entra es en los jobs batch nocturnos que mueven datos de sistemas transaccionales hacia el data lake, y en reintentar automáticamente los que fallan a las 3 a.m. sin que nadie tenga que despertarse.
Lo que no te cuenta la documentación oficial: el 80% de los proyectos reales en GCP combinan batch y streaming en el mismo pipeline, no uno u otro. Diseñar pensando solo en batch es la razón por la que después hay que rehacer media arquitectura cuando el negocio pide "datos casi en tiempo real".
Costos: el detalle que decide si el proyecto escala
GCP factura distinto cada pieza del stack: BigQuery por datos escaneados (o por slots reservados si tu volumen ya es alto), Dataflow por horas de worker activas, Pub/Sub por volumen de mensajes. Un pipeline mal diseñado — sin particiones, con workers que nunca se apagan — puede costar tres o cuatro veces más que uno equivalente bien armado, y la diferencia no se nota hasta que llega la primera factura grande.
Qué tan cerca estás de la certificación oficial
El bootcamp de DataPath incluye una sesión dedicada a preparación y mentoría para la certificación Google Cloud Professional Data Engineer, además de un proyecto final con presentación y resolución de dudas técnicas. No reemplaza estudiar el examen a fondo, pero sí te deja con la arquitectura clara en la cabeza, que es la parte que más cuesta aprender sola con documentación suelta. Si buscas específicamente la ruta de certificación oficial, puedes complementar con la guía de la certificación Google Cloud Professional Data Engineer.
Cómo se conecta esto con el resto de tu carrera
GCP es una de las tres nubes que te van a pedir en algún punto si sigues la ruta de Data Engineer de DataPath: en el camino completo también se cubren AWS y Azure, pero empezar por GCP tiene sentido si tu empresa ya usa Google Workspace o si apuntas a startups, que suelen preferir esta nube por el pricing de BigQuery frente a alternativas con infraestructura fija.
Qué te llevas al terminar
Al cerrar las 8 sesiones vas a tener un pipeline batch y uno en streaming corriendo de principio a fin en tu propia cuenta de GCP, no solo diapositivas. Revisa el temario completo, la duración y el proyecto final en la ficha del bootcamp.


