Gráfico causal

En Suposiciones obligatorias, se explicó que la suposición de intercambiabilidad condicional se aplica si se supone un gráfico causal que cumple con el criterio de puerta trasera.

Un gráfico causal muestra la relación entre las variables. Las variables se agrupan en colecciones (nodos), y una flecha entre los nodos indica que podría existir un efecto causal en la dirección de la flecha. Una flecha no siempre indica que hay una relación causal entre cada par de variables, pero sí que no puede existir tal relación en el sentido inverso para ningún par de variables.

Según el criterio de puerta trasera (Pearl, J., 2009), dado un diagrama causal, un conjunto de variables \(Z\) satisfará el criterio de puerta trasera en relación con una variable de tratamiento \(X\) y la variable de respuesta \(Y\) si se cumplen ambas de estas condiciones:

  • Ningún nodo de \(Z\) es subordinado de \(X\).
  • \(Z\) bloquea cada ruta entre \(X\) e \(Y\) que contiene una flecha hacia \(X\).

El modelado de combinación de marketing (MMM) se usa para estimar el efecto causal de las variables de medios pagados, de medios orgánicos y que no son de medios en un KPI (como las ventas). Por lo tanto, las variables de medios pagados, de medios orgánicos y que no son de medios son las variables de tratamiento (\(X\)) y el KPI es la variable de respuesta (\(Y\)). Para estimar este efecto causal a partir de una regresión de MMM, el MMM debe condicionar un conjunto de variables de control cuidadosamente seleccionadas que cumplan con el criterio de puerta trasera. En otras palabras, estas son las condiciones del criterio de puerta trasera:

  • No debes controlar ninguna variable mediadora. Las variables mediadoras son aquellas que se encuentran en la cadena causal entre \(X\) e \(Y\).
  • Debes controlar todas las variables de confusión. Las variables de confusión son aquellas que tienen un efecto causal en \(X\) y en \(Y\).

La variable de tratamiento del MMM es una colección de cualquier combinación de variables de tratamiento de medios pagados, de medios orgánicos y que no son de medios indexadas en función de la ubicación geográfica y el tiempo. Es difícil representar todas las variables de tratamiento en un gráfico, por lo que te recomendamos que utilices un gráfico simplificado que represente solo dos períodos dentro de una sola ubicación geográfica. Se supone que las ubicaciones geográficas son independientes, por lo que se puede usar el mismo gráfico para representar cualquiera de ellas. Además, no hay flechas ni relaciones entre las ubicaciones geográficas. Dos períodos son suficientes para describir el patrón de los efectos rezagados de las variables de tratamiento, que puedes suponer que se repite de forma indefinida en el futuro (o hasta cierta duración máxima de retraso).

Gráfico causal de Meridian

En el siguiente diagrama, \(T\) representa las variables de tratamiento de medios pagados, de medios orgánicos y que no son de medios; \(C\) representa los controles, y \(K\) representa el KPI. El número que sigue a cada variable indica el período. Dentro de cada período, se supone que las variables de tratamiento afectan las ventas y que las variables de control afectan tanto las variables de tratamiento como las ventas. En el siguiente diagrama, \(T\) de un período anterior afecta las ventas del período actual ("efecto rezagado"). El modelo de regresión de Meridian aplica la función de Adstock a las variables de tratamiento de medios pagados y orgánicos, pero no a las que no son de medios. Esto supone que las variables de tratamiento que no son de medios no tienen efectos rezagados. Incluir variables de tratamiento que no son de medios en el nodo \(T\) sigue siendo algo válido porque una flecha indica que puede existir un efecto causal entre cualquier par de variables en nodos conectados. Si incluyes variables de tratamiento que no son de medios en el nodo \(T\) , la presentación del DAG será más clara, y el DAG seguirá siendo válido para determinar qué variables satisfacen el criterio de puerta trasera.

DAG causal con efecto rezagado de una variable de tratamiento

Supongamos que debes estimar el efecto causal de la variable de tratamiento (\(T1\) y\(T2\)) en el KPI durante el período 2 (\(K2\)). En el gráfico, puedes ver que las variables de control del período 2 (\(C2\)) satisfacen el criterio de puerta trasera.

Las principales conclusiones son que, para cada período, la regresión del MMM se debe condicionar en función de lo siguiente:

  1. Medios pagados y orgánicos del período actual y de todos los períodos anteriores, hasta una duración máxima de retraso supuesta
  2. Variables de tratamiento que no son de medios del período actual únicamente
  3. Variables de control del período actual únicamente

Estos son algunos detalles importantes que debes tener en cuenta:

  • Una flecha de \(C1\) a \(C2\) no tiene ninguna implicación sobre qué variables se deben incluir en la regresión.
  • Una flecha de \(C1\) a \(K2\) requiere que la regresión incluya variables de control rezagadas. En la práctica, es mejor evitar esto si es posible, ya que podría aumentar significativamente la cantidad de parámetros de regresión.
  • Una flecha de \(T1\) a \(C2\) puede causar problemas. En este caso, \(C2\) actúa como variable mediadora y de confusión al mismo tiempo. No se puede usar un solo modelo de regresión de MMM para recuperar el efecto causal de la variable de tratamiento.
  • Agregar la ruta \(T2 \leftarrow K1 \rightarrow K2\) puede causar problemas por el mismo motivo. En este caso, \(K1\) actúa como variable mediadora y de confusión al mismo tiempo.

Meridian también es compatible con gráficos causales que incluyen controles rezagados, tal como se describe en Cuándo se necesitan variables de control rezagadas.

Gráfico causal de embudo completo de Meridian

Para resolver el dilema entre las variables de confusión y mediadoras, Meridian admite un gráfico causal de embudo completo mediante un enfoque de dos etapas (consulta MMM de embudo completo).

Período único

DAG causal de embudo completo (truncado)

En el diagrama, vemos el gráfico causal de embudo completo en un punto temporal.

Las variables de tratamiento se dividen en dos nodos:

  • \(B\) denota el marketing de marca, que es el que se espera que influya en la variable de valor de la marca \(G\).
  • \(O\) denota otras acciones de marketing, que pueden verse influenciadas por la variable de valor de la marca \(G\).

En la práctica, es útil identificar qué variables de marketing se consideran de marca. Para ello, hazte la siguiente pregunta: "¿Esta variable de marketing tiene un efecto causal en la variable de valor de la marca?". Si la respuesta es afirmativa, se debe incluir en\(B\). Si la respuesta es negativa, se debe incluir en \(O\). Recuerda que una flecha en un DAG representa una relación causal potencial. No requiere que la relación causal exista realmente. Por lo tanto, no es necesario que cada variable de marketing del nodo \(O\) se vea afectada de forma causal por la variable de valor de la marca. Por este motivo, es útil determinar primero las variables que se deben clasificar como marketing de marca y, luego, clasificar las variables restantes como otro tipo de marketing.

Para dar un ejemplo concreto, imagina que tenemos el GQV de marca (bGQV) como una variable de valor de la marca, que se categoriza en el nodo \(G\) . Se espera que un canal de anuncios de video genere valor de la marca y aumente el bGQV. Consideraríamos el canal de anuncios de video como una variable de marketing de marca y lo clasificaríamos en el nodo \(B\). Por otro lado, es probable que un canal de distribución de rendimiento del embudo inferior esté impulsado por el valor de la marca. Por lo tanto, lo consideraríamos como otro marketing y lo categorizaríamos en el nodo \(O\) . Para obtener más información sobre este ejemplo, consulta la explicación de Embudo completo de Meridian.

Las variables de control también se dividen en tres nodos:

  • \(V\) denota las variables que se confunden con el marketing de marca y la variable de valor de la marca \(G\).
  • \(Z\) denota las variables que se confunden con el marketing (ya sea de marca o de otro tipo) y el KPI \(K\).
  • \(W\) denota las variables que se confunden con el valor de la marca y el KPI \(K\).

Cada uno de los conjuntos \(V\), \(Z\)y \(W\) son variables de confusión para un efecto causal que estimamos en el modelo de embudo completo: \(V\) son variables de confusión para el efecto causal que el marketing de marca tiene en la variable de valor de la marca, \(Z\) son variables de confusión para el efecto causal que el marketing tiene en el KPI, y \(W\) son variables de confusión para el efecto causal que el valor de la marca tiene en el KPI. Al igual que en un MMM de una sola etapa, es importante considerar las variables de confusión para todos los efectos causales estimados.

Varios períodos con efectos rezagados

En el siguiente diagrama, se incorporan varios períodos en el gráfico, y el número que sigue al nombre de cada nodo indica el período. Esto agrega un diagrama para los siguientes efectos rezagados que se suponen en el gráfico causal de embudo completo de Meridian:

  • Marketing de marca \(B\) en el KPI \(K\)
  • Otros canales de marketing \(O\) en el KPI \(K\)
  • Valor de la marca \(G\) en el KPI \(K\)
  • Marketing de la marca \(B\) en el valor de la marca \(G\)
El DAG causal de embudo completo