Cómo medimos

Qué es esto, y qué NO es

La Canasta de Cobertura mide, todos los días, en cada cadena de supermercados y en cada ciudad de Argentina que reporta datos suficientes, un producto por cada uno de 23 rubros de consumo masivo — la canasta de referencia. Un segundo producto por rubro (hasta 40 en total) queda de respaldo: solo entra al cálculo cuando el de referencia no tiene dato fresco en una cadena puntual, nunca los dos juntos (ver la sección siguiente).

No es la Canasta Básica Alimentaria del INDEC. La CBA mide rubros genéricos en gramos para calcular el costo de una dieta mínima. Esta canasta mide productos concretos y con marca.

No es un índice de inflación. Compara el mismo día entre ciudades y cadenas, no un mes contra el anterior. La serie de evolución en el tiempo es un paso siguiente.

Cómo se eligen los rubros, y cómo se eligen los productos — son dos decisiones distintas

Esto cambió respecto de la primera versión de esta metodología, y vale la pena explicar por qué. La primera vuelta clasificaba los productos por rubro usando dos fuentes mezcladas — la categoría de góndola que declara cada cadena, y palabras clave sobre la descripción — y esas dos fuentes se pisaban entre sí. El resultado visible: la canasta salía con sal contada dos veces, tres marcas de hamburguesa congelada y ninguna de azúcar ni de pan.

Ahora los rubros los elegimos nosotros, de antemano, con una lista fija de 23 categorías de consumo masivo (aceite, arroz, fideos, harina, azúcar, yerba, leche, manteca, queso, yogur, dulce de leche, galletitas, pan, sal, mayonesa, puré de tomate, gaseosa, agua, café, té, lavandina, detergente, jabón para ropa) — cada una con su propia regla de qué palabras tiene que tener la descripción del producto y cuáles no. La categoría de góndola que declara cada cadena ya no decide el rubro: solo se usa como veto, para sacar del universo entero productos que no son de consumo masivo aunque su descripción los confunda con uno (perfumería, electrodomésticos, mascotas).

Los productos, dentro de cada rubro, los elige el dato: de los candidatos que matchean el patrón del rubro, no están vetados por categoría, y superan los umbrales de cobertura y sanidad de precio, se toman hasta dos por rubro, ordenados por cuántas cadenas y ciudades los reportan. Si un rubro no tiene ningún candidato que llegue al umbral, se publica igual, vacío, con el motivo — nunca desaparece en silencio.

Qué es una "ciudad" y cuándo se publica

Sin cambios: departamento oficial (IGN) cuando la sucursal está geolocalizada así, nombre de ciudad declarado y limpiado cuando no. La Ciudad Autónoma de Buenos Aires colapsa siempre en una sola ciudad, nunca en sus 15 comunas por separado. Se publica con al menos 3 cadenas y 5 sucursales frescas.

Qué precio se toma

Mediana del precio de lista entre las sucursales frescas de esa cadena en esa ciudad, sin promociones (la promoción se calcula aparte, como referencia).

Qué número es el principal: un índice, no un total en pesos

La canasta de referencia es un producto por rubro — 23 en total —, y es sobre eso que se calcula el número que se publica. Cada rubro puede tener un segundo producto guardado de respaldo (leche entera de otra marca, un segundo aceite de girasol), pero ese respaldo solo entra al cálculo cuando el producto de referencia no tiene precio fresco en una cadena puntual ese día — nunca se suman los dos juntos. Antes el número público sumaba hasta dos productos por rubro (40 en total, muchos de ellos la misma marca en dos tamaños distintos) y eso inflaba un "total en pesos" que no es una canasta que nadie compre: nadie lleva dos tamaños del mismo aceite en el mismo changuito.

Por eso el número que se destaca es un índice, con el promedio nacional en 100 — no un monto en pesos. Un índice de 114 en Bariloche dice "la canasta de referencia sale 14% más cara que el promedio del país", que es una comparación que tiene sentido pase lo que pase con la inflación general o con qué productos entraron este mes a la canasta. Si en algún lugar de la página se muestra igual un monto en pesos, va a decir explícitamente "canasta de referencia de 23 productos", con la lista de esos 23 productos al lado — nunca "total canasta" a secas, porque esa frase sugiere algo que se puede comprar tal cual, y esto no lo es.

Y hay dos preguntas distintas sobre precios que compiten entre cadenas y ciudades, y cada una tiene una sola respuesta en la página: "¿cuánto más cara es esta ciudad que el promedio del país?" se contesta una sola vez, con el índice de la ciudad. "¿qué cadena es más barata dentro de esta ciudad?" se contesta por separado, comparando cada cadena contra la mediana de su propia ciudad (índice = 100 ahí adentro) — nunca contra el promedio nacional. Antes las dos preguntas se contestaban con el mismo cálculo y daban dos números distintos para la misma ciudad, lo cual generaba desconfianza sin necesidad.

Qué se excluye, y por qué — la parte que más cambió

Un producto puede tener un precio nacional disparejo por dos motivos muy distintos, y tratarlos igual es un error: puede ser que una cadena puntual esté informando mal ese producto (precio del pack en vez de precio unitario, por ejemplo), o puede ser que el producto en sí tenga datos rotos en muchos lugares a la vez. La primera versión de esta canasta no distinguía los dos casos, y eso le costó un producto real: el agua mineral con gas quedaba afuera de la canasta entera porque, en un cálculo hecho sobre datos de varias semanas atrás, su precio máximo y mínimo nacional diferían en más de 5 veces. Al medir de nuevo sobre datos de hoy, ese mismo producto tiene un precio parejo en todo el país — el problema no era del agua, era de una cadena que en ese momento tenía datos viejos y que ya no forma parte de la red activa.

Por eso ahora el chequeo tiene dos pasos: primero se mira cada cadena por separado, y si su precio para ese producto puntual está muy lejos (fuera de la mitad o el doble) de la mediana nacional, esa cadena se aparta para ese producto — se anota, no se esconde. Recién con las cadenas sanas se calcula si el producto en su conjunto tiene un precio razonable. Un producto que pasa este segundo filtro entra a la canasta aunque alguna cadena puntual lo tuviera mal cargado.

Todo lo que se aparta —cadenas con un producto puntual fuera de rango, cadenas con datos internamente inconsistentes, cadenas sin actualizar, ciudades sin suficientes productos en común entre sus cadenas— se guarda y se publica, nunca se descarta en silencio. Es la mitad de la credibilidad de este informe.

Limitaciones honestas

  • El dato es el que cada cadena declara al gobierno, no lo que un cliente ve en la góndola.
  • Las ciudades chicas quedan agrupadas en "resto de provincia" — es estructural, no un defecto a corregir.
  • Los productos, por construcción, favorecen a las marcas líderes.
  • Algunos productos con nombre de marca pueden colarse en el rubro equivocado si su descripción menciona la palabra clave sin ser ese tipo de producto. Para el caso más conocido (agua saborizada de una marca que no dice "saborizada" en su descripción, como Aquarius) hay una lista negra de marcas por rubro — pero el nombre de marca que reporta una cadena a veces llega truncado a 5 caracteres en el feed (Aquarius → "AQUAR"), así que la lista negra compara por prefijo, no por palabra completa. No hay garantía de que cubra una marca nueva que todavía no se vio truncada así.
  • El segundo producto de un rubro tiene que ser de una marca distinta a la del primero — la comparación es por texto (mayúsculas, sin acentos, sin sufijos como "S.A."), así que dos nombres de fantasía de la misma empresa que se escriben distinto (por ejemplo, "Coca Cola" y "Sprite") cuentan como marcas distintas a propósito, y una misma marca truncada de dos formas distintas en dos filas del dato podría, en el peor caso, colarse como si fueran dos marcas. Si un rubro no tiene una segunda marca que llegue al mínimo de cadenas exigido, se publica con un solo producto — no es un error, es preferible a duplicar el peso de una sola marca.

Lo que viene

Con el snapshot diario acumulado, el paso siguiente es una serie de evolución del costo de la canasta en el tiempo. No se construye todavía.


Decisiones abiertas para Andrés

  1. Ventana de frescura: 3 días.
  2. Umbral de banderas por rubro: 12.
  3. Rubros y sus patrones: 23 rubros fijos en dbo.CanastaRubro, hasta 2 productos cada uno (1 para azúcar, sal, lavandina, puré de tomate y manteca). La lista y los patrones de cada uno son ajustables sin tocar código.
  4. Ciudad: departamento IGN cuando está geolocalizada, nombre declarado y limpiado si no.
  5. Mínimo para publicar ciudad: 3 cadenas y 5 sucursales.
  6. Cobertura mínima ciudad × cadena: 80%.
  7. Precio principal: de lista, sin promoción.
  8. Mercado Libre: afuera del informe geográfico por defecto (sin sucursales físicas).
  9. Banda de outlier por cadena: una cadena se aparta de un producto puntual si su mediana está fuera de [0,5x, 2,0x] la mediana nacional de ese producto.
  10. Ratio máximo intra-cadena: 3x entre las propias sucursales de una cadena para el mismo producto — por encima de eso, se marca la cadena para revisión de carga, aunque no se la excluye del cálculo.

Esta página se genera desde el documento de metodología del repositorio; si algo no cierra, los datos abiertos permiten rehacer cada número.