Caso de estudio · The Growth Journey
Sistema de Customer & Competitive Intelligence — Amazon Reviews V1
De 2.302 reseñas de Amazon a evidencia competitiva sobre cinco marcas de audio premium.
Desarrollado inicialmente como proyecto final de un Bootcamp de Data Analytics & AI y posteriormente refinado como pieza de portafolio y evidencia profesional.
Case Study — Data & Market Intelligence
Sistema deCustomer & Competitive Intelligence
Amazon Reviews — V1 2.302 reseñas de Amazon. Cinco marcas de audio premium. Siete dimensiones de producto.
El proyecto de un vistazo
El problema empezó antes que la tecnología
La idea surgió mientras buscaba una pregunta para mi proyecto final de Data Analytics & AI. Durante ese proceso me llamaron la atención los informes de Amazon sobre el crecimiento de los negocios independientes que venden dentro de su plataforma.
En 2023, Amazon informó que más de 10.000 vendedores independientes habían superado por primera vez el millón de dólares en ventas. Para 2024, más de 55.000 vendedores habían generado más de un millón de dólares y, en 2025, la cifra superó los 75.000, un aumento del 36% respecto al año anterior. El dato de 2023 mide específicamente a quienes cruzaron ese umbral por primera vez y, por tanto, no es directamente equivalente a las cifras totales de 2024 y 2025.
Más que la cifra aislada, me interesó la realidad empresarial que había detrás: miles de negocios compitiendo dentro de un entorno donde productos, precios, competidores y opiniones de clientes pueden observarse prácticamente lado a lado.
En Amazon, un comprador puede comparar características y alternativas y, unos centímetros más abajo, encontrar cientos o miles de personas explicando qué valoran, qué las decepciona, qué funcionó y qué no volverían a comprar. Una reseña aislada puede ser anecdótica. Miles de ellas contienen patrones, fricciones y comparaciones que potencialmente dicen algo sobre la posición de un producto frente a sus competidores.
El proyecto nació inicialmente como un ejercicio de sentiment analysis, pero pronto evolucionó hacia una pregunta más amplia.
Si una marca compite en este segmento, ¿dónde está ganando y dónde está perdiendo frente a sus competidores directos según lo que expresan las reseñas, y qué parte de esas diferencias puede sostenerse con suficiente evidencia como para ser algo más que una comparación superficial de promedios?
Para trabajar con una situación concreta elegí auriculares premium over-ear con cancelación activa de ruido. Sennheiser se convirtió en la marca ancla frente a Bose, Sony, Bang & Olufsen y Bowers & Wilkins. Utilizar una empresa y un mercado reales hacía más concreta la pregunta; no convertía, sin embargo, un proyecto académico y de portafolio en un trabajo de cliente que nunca ocurrió.
Construir el sistema antes de buscar respuestas
Responder la pregunta exigía algo más que descargar reseñas y calcular promedios. Necesitaba construir un proceso que conservara el vínculo entre lo escrito en las reviews y las conclusiones que aparecerían al final del análisis.
Eso implicaba resolver tres problemas distintos: definir correctamente qué productos pertenecían al conjunto de competidores, transformar lenguaje no estructurado en variables analizables y comprobar que el modelo utilizado para interpretar las reseñas fuera suficientemente fiable antes de aplicarlo a todo el conjunto de datos.
Organicé el proyecto siguiendo las seis fases de CRISP-DM y una arquitectura de datos bronze/silver/gold. Python se utilizó para exploración, preparación y análisis; MySQL para estructurar y validar información; modelos de lenguaje para interpretar las reseñas; métodos estadísticos para evaluar modelos y contrastar determinados resultados; y Tableau para construir la experiencia visual.
La fuente fue el conjunto de datos público Amazon Reviews 2023, desarrollado por McAuley Lab en UC San Diego. Trabajé sobre la categoría Electronics, seleccioné líneas concretas dentro del segmento premium ANC y establecí un precio mínimo de 150 dólares. El conjunto inicial contenía 2.312 reseñas; después de la limpieza y eliminación de diez duplicados estrictos quedaron las 2.302 observaciones utilizadas en el análisis.
Llegar hasta ese conjunto proporcionó una de las primeras lecciones importantes del proyecto. Un filtro inicial llegó a clasificar productos AKG como si fueran Sennheiser, mientras que una búsqueda demasiado genérica devolvía 1.154 coincidencias para Sony. El problema no estaba todavía en la AI ni en la estadística. Estaba en haber definido de manera insuficientemente precisa aquello que pretendía comparar.
La solución fue trabajar con familias concretas de producto —Momentum, QuietComfort, WH-1000X y las líneas correspondientes de las otras marcas—. La unidad de análisis también se volvió más precisa: no estaba comparando “Sennheiser contra Bose” en términos absolutos, sino determinadas líneas premium ANC dentro del alcance permitido por el conjunto de datos.
Aquella corrección cambió menos código que significado. Un análisis puede ser técnicamente sólido y seguir respondiendo a la pregunta equivocada si la realidad que entra en él está mal definida.
El sistema terminó evaluando siete dimensiones: calidad de sonido, cancelación de ruido, comodidad, batería, construcción y diseño, relación calidad-precio y software/conectividad. Esta última no formaba parte del esquema inicial; apareció durante el etiquetado manual, cuando referencias a Bluetooth, firmware y aplicaciones mostraron que el modelo conceptual original estaba dejando fuera una parte relevante de la experiencia de producto.
Construir evidencia antes de escalar la AI
Conectar un modelo y procesar directamente las 2.302 reseñas era técnicamente posible. El problema era que una respuesta bien estructurada no demuestra por sí sola que la interpretación sea correcta. Si existía un error sistemático, escalar el flujo de procesamiento sólo conseguiría reproducirlo miles de veces.
Por eso construí primero un conjunto de referencia (ground truth) de 200 reseñas etiquetadas manualmente, 40 por marca. Cada una recibió una evaluación de sentimiento general y de las siete dimensiones de producto siguiendo el mismo esquema que posteriormente utilizarían los modelos.
Comparé después Llama 3.3 70B y GPT-OSS 120B. Antes de conocer sus resultados fijé los criterios que debían superar. Ambos modelos cumplieron el estándar y la comparación pareada mediante Wilcoxon produjo p = 0,757, por lo que los datos no permitían declarar un ganador estadístico.
Dos modelos superaron el estándar. Elegir exigió algo más que buscar un ganador.
| Métrica | Llama 3.3 70B | GPT-OSS 120B |
|---|---|---|
| Polarity accuracy | 90,0% | 91,5% |
| Cohen’s Kappa | 0,722 | 0,763 |
| Macro F1 | 0,763 | 0,608 |
| Schema retries | 3,5% | 5,5% |
| Tiempo / reseña | 9,4 s | 28,8 s |
| Costo total estimado | $0,41 | $0,34 |
Seleccionado por la combinación de velocidad, confiabilidad operativa y comportamiento más equilibrado en determinadas métricas, sin borrar las ventajas observadas de GPT-OSS en otras dimensiones.
Qué encontró el análisis
Una vez procesadas las reseñas, el reto dejó de ser principalmente técnico. Ahora era necesario decidir qué significaban realmente las diferencias encontradas.
Los promedios permitían comparar rápidamente las cinco marcas a través de las siete dimensiones. Pero una diferencia observada no era automáticamente una ventaja competitiva demostrada. Para determinadas conclusiones principales utilicé bootstrap para estimar intervalos de confianza y comprobar si las diferencias resistían un análisis adicional.
En calidad de sonido, Sennheiser obtuvo el promedio más alto, con 0,755 frente a 0,748 de Bose. Sin embargo, el intervalo de confianza de la diferencia cruzaba el cero. En cancelación de ruido, Sennheiser registraba 0,299 frente a 0,781 de Bose y 0,767 de Sony, y las diferencias frente a ambas marcas sí permanecían estadísticamente significativas. En batería, la diferencia frente a Sony también quedó estadísticamente confirmada.
Observar una diferencia no significa haber demostrado una ventaja.
Calidad de sonido
Sennheiser 0,755
Bose 0,748
95% CI de la diferencia
−0,071 → +0,088
Mayor promedio observado. Sin ventaja estadísticamente demostrada.
Cancelación de ruido
Sennheiser 0,299
Bose 0,781
Sony 0,767
Brecha significativa vs Bose
Brecha significativa vs Sony
Desventaja respaldada frente a Bose y Sony dentro de esta muestra.
Batería
Sennheiser 0,408
Sony 0,741
Brecha significativa vs Sony
Desventaja respaldada frente a Sony dentro de esta muestra.
“Tiene el promedio más alto” no significa necesariamente “posee una ventaja demostrada”. Y “ocupa la última posición” tampoco significa automáticamente “es significativamente peor que todos sus competidores”.
La posición competitiva cambia según la dimensión analizada.
Una misma marca puede ocupar posiciones muy distintas dependiendo de qué parte de la experiencia de producto estemos observando.
El análisis no produce una única jerarquía de marcas válida para toda la experiencia de producto.
Cuando la evidencia cambió la respuesta
El análisis no sólo produjo información sobre las marcas. También obligó a revisar algunas de las hipótesis con las que había comenzado. El caso de calidad de sonido fue especialmente importante porque exigía abandonar una interpretación favorable: “Sennheiser gana en sonido” era una narrativa coherente con la reputación de la marca y fácil de comunicar; después del análisis estadístico, dejó de ser una conclusión defendible.
Sin ventaja estadísticamente demostrada.
El estándar tenía que ser el mismo cuando la evidencia favorecía la historia que cuando la contradecía.
El proyecto incorporó además una pequeña capa experimental destinada a detectar posibles señales de seguridad que podían desaparecer dentro de los promedios.
Las marcas se anonimizaron en el panel público porque unos pocos casos individuales no proporcionan una base responsable para formular afirmaciones generales. Además, el detector no permitía estimar cuántos casos podrían haber utilizado vocabulario diferente y permanecer sin identificar. Los tres hallazgos eran, por tanto, señales observadas, no una tasa de fallos ni una estimación de prevalencia.
Del hallazgo a la decisión
Encontrar una diferencia competitiva tampoco resuelve automáticamente qué debería hacer una organización con ella. La brecha en cancelación de ruido frente a Bose y Sony podía justificar una investigación adicional. No proporcionaba, sin embargo, evidencia suficiente para recomendar por sí sola una decisión costosa o difícil de revertir, como rediseñar hardware o modificar una plataforma de producto.
¿Por qué aparece esta diferencia frente a Bose y Sony, y encontramos el mismo patrón en nuestros datos internos?
La siguiente capa de evidencia podría encontrarse en devoluciones, garantías, customer support, encuestas propias, telemetría o una investigación adicional con otro diseño.
Las reseñas pueden ayudar a indicar dónde mirar. No necesariamente tienen autoridad suficiente para decidir qué hacer.
Cuanto mayor sea el costo, riesgo o irreversibilidad de una decisión, mayor debería ser también el nivel de evidencia necesario antes de comprometerla. En ese sentido, el análisis no sustituye el criterio profesional: mejora el contexto en el que ese criterio debe ejercerse.
Dónde terminan las conclusiones
La utilidad del proyecto depende también de hacer visibles sus límites. Las 2.302 reseñas permiten observar patrones dentro del conjunto de datos analizado, pero no representan toda la experiencia de los clientes de estas marcas ni un estudio controlado de todo el mercado de audio premium.
- Source
- Amazon como única fuente; datos hasta septiembre de 2023.
- Sampling
- Cap de 500 reseñas para cuatro marcas; Bang & Olufsen quedó en 312 como población completa bajo los filtros.
- Product generations
- Algunas líneas agrupan distintas generaciones dentro del mismo family scope.
- Price coverage
- Sennheiser: aproximadamente 47,3% de cobertura de precio.
- Ground truth
- Un único anotador humano; no se midió inter-annotator agreement.
- Safety detection
- El detector basado en palabras clave no permite estimar el false-negative rate.
- Reuse
- Arquitectura diseñada para reutilizarse; transferencia cross-category todavía no demostrada.
La arquitectura fue diseñada para ser reutilizable. Que mantenga su calidad al cambiar de categoría todavía necesita ser demostrado.
Evidencia del proyecto
Evidencia y entregables del proyecto
El caso de estudio explica el problema, las decisiones y los límites. Los recursos externos permiten explorar el trabajo con mayor profundidad.
Explorar el análisis completo
Clasificaciones, dimensiones, evaluación de modelos, frecuencia de menciones y niveles adicionales de detalle están disponibles en el panel interactivo.
Revisar la evidencia técnica pública
El repositorio público incluye una selección de exploración, extracción, SQL y documentación. El motor completo permanece en el repositorio privado.
Siguiente iteración
Amazon Reviews V2: probar antes de generalizar
La siguiente iteración continuará dentro de la misma línea Amazon Reviews, pero cambiará la categoría de producto y la marca ancla. Ambas permanecen todavía por decidir.
El propósito de V2 no es confirmar que V1 funciona universalmente. Es comprobar qué sucede cuando la arquitectura se enfrenta a otro contexto: otro vocabulario de clientes, otras dimensiones relevantes del producto y otra lógica competitiva.
También incorporará mejoras surgidas directamente de V1, entre ellas sustituir el detector de seguridad basado en palabras clave por una evaluación contextual integrada en cada reseña y reorganizar el panel interactivo para separar con mayor claridad una capa de resumen de otra de exploración detallada.
V2 no debe demostrar que V1 tenía razón. Debe poner a prueba qué partes de V1 merecen sobrevivir.
Existe una dirección posterior y distinta: explorar si la lógica puede evolucionar más allá de Amazon hacia fuentes como Google Maps, Yelp o TripAdvisor. Esa etapa plantearía problemas nuevos de adquisición, normalización y comparabilidad de datos que todavía no han sido diseñados. No forma parte de V2 ni representa una capacidad que V1 ya haya demostrado.
Lo que queda después de 2.302 reseñas
El proyecto comenzó con una pregunta sobre Amazon, reseñas y AI y terminó obligándome a prestar tanta atención a los límites de una conclusión como a la conclusión misma.
Hubo filtros que tuvieron que corregirse, una dimensión de análisis que apareció después de empezar el etiquetado, dos modelos que superaron el estándar sin producir un ganador estadístico claro y una conclusión favorable sobre calidad de sonido que dejó de ser defendible cuando fue sometida a mayor escrutinio.
La tecnología permitió analizar información a una escala difícil de abordar manualmente. La estadística ayudó a distinguir algunas señales de diferencias que podían deberse a variación. Pero ninguna sustituyó la necesidad de definir correctamente el problema, decidir qué evidencia era suficiente, reconocer cuándo una hipótesis había fallado o evitar que un hallazgo se convirtiera prematuramente en una recomendación.
El valor del proyecto no está solamente en haber encontrado diferencias entre cinco marcas. Está en haber construido un proceso capaz de distinguir entre lo que parecía cierto, lo que los datos sugerían y lo que la evidencia realmente permitía defender.
V1 es útil como punto de partida no porque haya cerrado todas las preguntas, sino porque dejó suficientemente claro cuáles merecen ser puestas a prueba de nuevo.
Nota del proyecto. Sistema de Customer & Competitive Intelligence — Amazon Reviews V1 fue desarrollado originalmente como trabajo final de un Bootcamp de Data Analytics & AI y posteriormente refinado como pieza de portafolio y evidencia profesional. Sennheiser fue utilizada como marca ancla; Sennheiser, Bose, Sony, Bang & Olufsen y Bowers & Wilkins no encargaron ni participaron en el análisis. No existe relación comercial entre este proyecto y Amazon. Los datos analizados proceden del dataset público Amazon Reviews 2023 de McAuley Lab, UC San Diego.

