Gestión de soluciones con sistemas de almacenamiento y herramientas del centro de datos para la resolución de problemas
Sumario
- 1 Introducción
- 2 Qué es el Big Data: definición
- 3 Origen del Big Data
- 4 Origen de los datos
- 5 Estructura de los datos
- 6 Las “V” del Big Data
- 7 Infraestructura
- 8 Usos del Big Data
- 9 Casos prácticos de aplicación y éxito empresarial
- 10 AAPP
- 11 Profesiones asociadas
- 12 Desafíos en el mundo del Big Data
- 13 Importancia del Big Data. Conclusiones
- 14 Bibliografía y Referencias
Introducción
Aunque emplearemos en este curso el término “Big Data”, tenemos que señalar que la RAE lo considera un extranjerismo y sugiere usar el término “macrodatos”.
Cada vez que entramos en una página web estamos facilitando una serie de datos sobre nuestra actividad online. Por ejemplo, si somos visitantes habituales o a qué sitios accedemos y cómo lo hacemos. Esto genera una gran cantidad de información.
También cuando vamos por la calle, a través de la geolocalización de nuestros teléfonos, las redes wifi o cámaras de vigilancia, se puede recabar una enorme cantidad de datos que puede convertirse en información útil.
Hoy en día, millones de dispositivos comparten información por Internet. Big Data se encarga de analizar este océano de datos para convertirlo en la información que está transformando el mundo.
El objetivo de Big Data es convertir el dato en información, para facilitar su análisis y así aprovechar su contenido. Actualmente el análisis de los datos se ha convertido en una ayuda para muchas empresas en la toma de decisiones.
Big Data hace referencia a las combinaciones de datos cuyo tamaño, complejidad y velocidad dificultan la captura, gestión, procesamiento y análisis por parte de las herramientas de software tradicionales. El estudio de Big Data se hace complejo debido principalmente a que la mayoría de los datos generados por las tecnologías modernas, como las búsquedas en Internet, las redes sociales, teléfonos inteligentes entre muchas otras, son datos no estructurados, más difíciles de analizar que los datos estructurados habituales hasta ahora.
El uso de tecnologías de Big Data en empresas españolas y europeas está en constante evolución. Actualmente está más implantado en el 30% de empresas españolas mayores de 250 empleados, aunque su implantación es mayor en Francia (37%) o Alemania (34%). En el caso de las pymes (de 10 a 250 empleados) el uso es bastante menor, el 10% de las empresas españolas y el 12% de las europeas usan Big Data.
También es muy distinto el uso que hacen las empresas en función del sector de actividad en el que se desarrolla su actividad económica. En España las empresas que más utilizan Big Data son las del sector turístico, agencias de viajes, reservas de operador turístico, etc., el 32% de las empresas de este sector lo usan. Le siguen las empresas de los sectores relacionados con las tecnologías, como el de Información y Comunicaciones (TIC) (30%), y las de reparación de computadoras y equipos de comunicación (27%). También podemos destacar las empresas de transporte y almacenamiento (19%) y las de electricidad, gas, aire acondicionado y suministro de agua (16%).
En función del sector la fuente de información que se utilice para hacer análisis Big Data también varía. Así las empresas de transporte y almacenamiento y las del sector TIC destacan por utilizar datos procedentes de geolocalización de dispositivos móviles. Las empresas del sector turístico son las que más utilizan los datos procedentes de redes sociales.
Hay varias propiedades que definen el término Big Data. Volumen, velocidad y variedad, son la clave para entender cómo podemos medir los Big Data y lo diferentes que son de los datos tradicionales. Se estudiarán con detalle en este tema.
El análisis de grandes volúmenes de datos comienza a convertirse en una prioridad para los negocios hasta el punto de nuestro rastro digital se puede utilizar y analizar; añadido a que los avances en tecnología, junto a la expansión de Internet y el almacenamiento en la nube, han provocado que crezca la cantidad de datos que podemos almacenar.
Esta nueva tecnología se ha convertido en una oportunidad de negocio, ya que permite a las empresas conocer a sus clientes, además de profundizar en sus necesidades y en la forma que tienen de actuar frente a los productos y servicios. Todo esto es algo que las empresas aprovechan, cada vez más, para conseguir nuevas oportunidades de negocio, lo que ha promovido un gran desarrollo de esta tecnología.
Qué es el Big Data: definición
Si buscamos en Google el término Big Data, encontraremos diferentes resultados, entre los cuales veremos de forma repetida palabras como “masivos”, “grandes conjuntos de datos”, “Petabytes” y “Exabytes”.
Big Data es el concepto que engloba enormes volúmenes de datos, en diversos formatos y obtenidos de diferentes fuentes. Se trata de una cantidad de datos tan compleja que las tradicionales herramientas de administración de datos no eran capaces de capturar, tratar y poner en valor de forma eficiente. Igualmente, el mismo término se refiere a las nuevas tecnologías que hacen posible el almacenamiento y procesamiento, además de al uso que se hace de la información obtenida a través de dichas tecnologías. Desde su origen han existido diversas definiciones de lo que se significa Big Data:
- Gartner, la empresa consultora define el Big Data como “aquellos recursos de información caracterizados por su alto volumen, velocidad o variedad, que requieren formas de procesamiento innovadoras y eficientes para la mejora del conocimiento y la toma de decisiones”.
- IBM define a Big Data como “La tendencia en el avance de la tecnología que ha abierto las puertas hacia un nuevo enfoque de entendimiento y toma de decisiones, la cual es utilizada para describir enormes cantidades de datos (estructurados, no estructurados y semi estructurados) que tomaría demasiado tiempo y sería muy costoso cargarlos a un base de datos relacional para su análisis. De tal manera que, el concepto de Big Data aplica para toda aquella información que no puede ser procesada o analizada utilizando procesos o herramientas tradicionales”.
- Oracle compañía de software referente en bases de datos, da la siguiente definición: “Big Data describe una estrategia holística de gestión de la información que incluye e integra muchos nuevos tipos de datos y de gestión de datos junto con datos tradicionales”.
Podemos denominar Big Data como la gestión y el análisis masivo de grandes volúmenes de datos a un coste accesible: un conjunto de datos estructurados y no estructurados, de gran volumen, que provienen de diversas fuentes. También recibe otros nombres, como datos masivos o a gran escala, macrodatos o inteligencia de datos
El Big Data engloba:
- Un conjunto masivo de datos.
- Las herramientas donde se almacenan esos datos.
- El software con los que se procesan esos datos.
- Cómo se aplican esos datos: qué se hace con esa información una vez procesada.
El Big Data precisa una serie de aplicaciones informáticas específicas para su procesamiento y uso, herramientas especiales que almacenan y ordenan los datos, les dan sentido y hacen que sean útiles, esto es, los convierte en información valiosa. Estamos hablando de conjuntos que pueden alcanzar un tamaño de 30-50 terabytes que requieren de bases de datos no relacionales y programas estadísticos para su visualización apropiada.
Origen del Big Data
La historia del Big Data como término es breve, pero su base se fue construyendo mucho antes de aparecer los ordenadores en nuestra vida. A finales del XVII, Graunt lleva a cabo el primer experimento registrado de análisis de datos estadísticos sobre defunciones, con el cual diseña un sistema de alerta temprana de la terrible peste bubónica que asolaba Europa.
El siglo XX es definitivo con la invención del almacenamiento digital. Por la creciente generación de datos y la necesidad de poder registrarlos y analizarlos a tiempo, en 1965 el gobierno de los Estados Unidos planeó el primer “Data Center” del mundo para almacenar en cinta magnética 742 millones de declaraciones de impuestos y 175 millones de huellas dactilares.
Las predecesoras del Big Data fueron las primeras bases de datos, que se desarrollaron entre los 60 y los 70. A partir de los 70, empezaron a surgir sistemas como Teradata, precedentes a lo que ahora llamamos Big Data. Sin embargo, presentaban dos problemas:
- Su elevado coste los hacía accesibles solo a compañías muy grandes.
- Admitían solamente datos estructurados, con lo que era necesario desarrollar preprocesos ad-hoc para estructurar la información.
Los sistemas de inteligencia de datos que preceden de modo inmediato al Big Data se desarrollaron desde los años 80. Se denominaban Business Intelligence y se basaban en un almacenamiento centralizado y estructurado de todos los datos relativos a los procesos de negocio de la organización, enriquecidos con datos externos (Data Warehouse). Esencialmente, realizaban las mismas funciones que los sistemas Big Data actuales para las necesidades existentes en ese momento.
A finales de los 80 empieza a utilizarse el término Big Data tal y como lo empleamos en la actualidad.
En los 90, con el nacimiento del primer navegador web, World Wide Web, y con la apertura de Internet, se comenzó a crear una red de conexión de ordenadores en el mundo donde cualquier persona puede subir datos. Supuso la primera generación de datos masivos.
En 1997 Google lanza su motor de búsqueda, también favoreció la creación de datos masivos.
En el 2000 surgen empresas que generan y almacenan de forma segura grandes cantidades de datos para dar facilidades a las empresas.
Con el nacimiento de la Web 2.0 o Web Social en 2005 aparecieron páginas donde se pueden compartir la información, promoviendo así la colaboración y la interacción entre los usuarios, suponiendo una evolución trascendental en el uso de Internet y aumentando el volumen de datos a almacenar.
Los avances en tecnología, junto a la expansión de Internet y el almacenamiento en la nube, han provocado que crezca la cantidad de datos que podemos almacenar.
Los primeros en reseñar el Big Data son investigadores de la NASA, tratan sobre la visualización de grandes datos, más de 100 Gigabytes que requieren infraestructura adicional a la empleada hasta ese momento.
Procesamiento de datos
El gran punto de inflexión en el procesamiento de datos llegó de la mano de Google. En 2004, el gigante lanzó MapReduce, modelo de programación que permite la gestión de grandes volúmenes de datos gracias a la computación en paralelo, que permitía reducir el tiempo necesario para procesar la información.
Fue su solución para procesar los datos de las webs indexadas y calcular el Page Rank, es decir, el ranking de resultados que aparece cada vez que hacemos una consulta en el buscador, y todo ello a un coste razonable.
Antes de eso, Google había tanteado primero a los grandes proveedores de hardware y había valorado lo que le costaría montar las máquinas, redes… necesarios para gestionar el volumen ingente de datos que necesitaban procesar y almacenar. Ante la magnitud de los costes, el buscador decidió investigar por su cuenta. Como casi siempre, fue un problema de ROI lo que impulsó a Google a crear esta nueva tecnología.
El 1 de abril de 2006 se dio un paso más en este terreno, con el lanzamiento de Hadoop. Se trata de un software de trabajo de licencia libre que permite que las aplicaciones trabajen con grandes volúmenes de datos, un proyecto de la fundación Apache, especializada en desarrollos colaborativos de código abierto.
Almacenamiento de datos
El mismo año del lanzamiento de MapReduce, Google comenzó a desarrollar otro gestor al que llamó Cloud Bigtable, un sistema de base de datos NoSQL constituido dentro del Google File System, que permite almacenar datos en la nube.
Los expertos en la materia lo consideran predecesor de Casandra, HBase y otros sistemas de almacenamiento de datos NoSQL, que son los que se utilizan en la actualidad para trabajar con grandes volúmenes de datos.
Por qué ha surgido el Big Data?
Almacenar datos no es nuevo, las empresas guardan información acerca de sus clientes, proveedores y operaciones. La administración dispone de enormes bases de datos que contienen información sobre censos de población, registros médicos e impuestos. Pero hasta ahora las empresas no hacían mucho más con esos datos que almacenarlos, porque procesarlos era costoso en tiempo y en esfuerzo.
Ahora el almacenamiento ha tenido una gran evolución. Hace dos décadas hacía falta una máquina del tamaño de un frigorífico y con un peso de 800 kilos para almacenar un gigabyte de datos. Hoy en día cabe más en nuestro smartphone.
El precio de los dispositivos de almacenamiento también ha bajado. En esas dos décadas de las que hablamos, el coste de almacenar un gigabyte ha pasado de más de 700 euros a cuatro o cinco céntimos.
Además, la velocidad de procesamiento ha aumentado enormemente con la aparición, a principios de los años 2000, de la computación paralela masiva. En vez de procesar tareas de una en una, ahora los ordenadores pueden procesar una gran cantidad de tareas en paralelo, es decir, todas a la vez. Así es como Google, Facebook o Amazon han sido capaces de construir sus servicios.
No sólo el hardware ha aumentado su velocidad. También ha sido decisiva la aparición de software inteligente que permite sacar partido de la capacidad de procesamiento paralelo, analizando grandes cantidades de datos en muy poco tiempo. Un detalle importante es que este software inteligente puede analizar, no sólo datos almacenados y estáticos, sino también datos volátiles que se analizan en tiempo real a la vez que se producen. Además de todo esto, han aparecido nuevos tipos de datos que se generan de forma masiva, como correos electrónicos, mensajes de Facebook, tuits o vídeos de YouTube.
La principal diferencia entre estos nuevos tipos de datos y los que se han venido recogiendo hasta ahora es que estos últimos son datos estructurados, es decir, bien organizados, como los que pueden aparecer en una hoja de cálculo o en una base de datos, mientras que los primeros carecen de una estructura identificable. El análisis de estos datos no estructurados es mucho más difícil, pero a la vez también mucho más valioso.
Las necesidades de gigantes como Google fueron incrementándose con el paso del tiempo. En un momento dado, se tuvieron que plantear qué hacer con tanta cantidad de datos y cómo sacar provecho de los mismos. Esto les llevó a comprender que, si analizaban toda la información que recopilaban, podían llegar a entender mejor el mercado y a crear estrategias personalizadas en base a esos datos con el objetivo de satisfacer mejor las necesidades de los consumidores.
Así, toda esa información se convirtió en la nueva clave para tomar decisiones inteligentes y acertadas minimizando riesgos. Además, lo más importante, podían predecir el comportamiento de los consumidores y estar en el momento exacto en el que quisieran satisfacer alguna necesidad.
La Industria 4.0, también llamada industria inteligente, se considera la cuarta revolución industrial y busca transformar a la empresa en una organización inteligente para conseguir los mejores resultados de negocio.
El cambio se basa en la adopción de las nuevas tecnologías para la progresiva automatización del proceso productivo. El Big Data es una de las tecnologías asociadas a esta cuarta revolución industrial.
Origen de los datos
Tipos de datos por su procedencia
Hace unos años, los datos que se almacenaban se extraían, principalmente, de hojas de cálculo y bases de datos. En la actualidad los datos vienen de fuentes muy diversas:
- La web y redes sociales: se genera por usuarios en las redes sociales o la información de búsqueda en los buscadores. Nuestros movimientos en la red están sujetos a todo tipo de mediciones que tienen como objeto estudios de marketing y análisis de comportamiento. Por ejemplo, cuando se realizan mapas de calor basados en el rastreo del movimiento del cursor por parte de los usuarios de una web, en la detección de la posición de la página, o en el seguimiento de desplazamiento vertical a lo largo de esta. Con esos datos se llega a conclusiones tales como qué partes de una página atraen más al usuario, dónde hace clic o en qué zona de esta pasa más tiempo.
- Machine to Machine: Entre máquinas también se comparten datos directamente, en lo que se conoce igualmente como M2M, que viene del inglés «machine to machine». Así, los termómetros, parquímetros y sistemas de riego automático de las ciudades, los GPS de vehículos y teléfonos móviles, las máquinas expendedoras de bebidas y alimentos en un hospital, o los contadores de electricidad de las viviendas, por poner unos pocos ejemplos, se comunican a través de dispositivos con otros aparatos, a los que transmiten los datos que van recogiendo. Las redes de comunicación para llevar a cabo estas acciones son muy variadas. Entre las más conocidas están el Wifi, el ADSL, la fibra óptica y el Bluetooth.
- Transacciones: estos datos incluyen diversos registros de facturación, transacciones bancarias o llamadas entre cuentas.
- Biométricos: estos datos se generan por sensores de huellas dactilares, escáneres de retina, lectores de ADN, sensores de reconocimiento facial o reconocimiento de voz. Su uso es muy extendido en materia de seguridad.
- Generados por personas: estos datos son generados a través de servicio de mensajería, correos electrónicos o grabaciones de llamadas.
- Generados por organizaciones: organizaciones públicas y privadas son las que generan este tipo de datos y se relacionan con el medio ambiente, estadísticas sobre economía, población, historiales clínicos, etc.
La creciente obtención de datos es tan grande que agota el potencial de las infraestructuras IT tradicionales. Según IBM el 90% de los datos del mundo actual han sido creados solo en los últimos dos años. Posteriormente el abaratamiento de los sensores y su miniaturización, así como la interconexión de los objetos están contribuyendo a lo que actualmente conocemos como el Internet de las cosas (IoT), otra fuente importante de datos para el Big Data.
Según informes recientes, el número de dispositivos conectados a IoT seguirá aumentando en los próximos años hasta alcanzar los 66.000 millones de unidades en el año 2026.
En redes sociales podemos percibir a la velocidad que viaja la información cuando mensajes o videos se hacen virales en pocos segundos. La velocidad a la que se producirán los datos en un futuro será titánica y por ello debemos adelantarnos, gestionándolos, transformándolos en información precisa y fiable. Será un factor fundamental para marcar diferencias entre empresas.
Estructura de los datos
La categorización de los datos es importante para analizarlos de la manera adecuada, en Big Data se definen tres tipos atendiendo a su forma, datos estructurados, datos no estructurados y datos semi-estructurados.
Datos estructurados
Este grupo recoge todos aquellos datos que se pueden almacenar, acceder y procesar en forma de formato fijo. Son datos que tienen definido su tamaño, longitud, formato y esta información se almacena en bases de datos. Este tipo de datos representan aproximadamente el 20% de los datos disponibles e incluyen números, fechas y grupos de palabras. Son los que estamos acostumbrados a tratar.
Forman parte de una estructura predefinida. Como ejemplos encontramos una hoja de Excel o una base de datos SQL. Son fácilmente catalogables, y pueden ser utilizados para posteriores análisis y predicciones fiables. Pueden ser ordenados y procesados fácilmente por todas las herramientas de minería de datos.
Datos no estructurados
No siguen un formato específico, no tienen ni forman parte de una estructura definida. Siguen su forma original, tal y como fueron recogidos. Son la mayoría de los datos que se recogen. No tienen un formato concreto que nos permita almacenarlos de forma tradicional, porque la información no puede desglosarse.
En este grupo estarían:
- Correos electrónicos
- Archivos de texto
- Hojas de cálculo
- Publicaciones en redes sociales y páginas web
- Contenido multimedia como audio, vídeo, o imágenes
Contienen mucha información valiosa, pero al no estar bien estructurada y catalogada, su uso resulta complicado a la hora de crear informes y realizar análisis. Las últimas tendencias en Inteligencia Artificial, especialmente los algoritmos de Machine Learning, contemplan el análisis de datos no estructurados con el objetivo de obtener conclusiones fiables; es un campo complejo y en evolución, pero con un futuro muy prometedor. Estos datos adquieren su valor una vez son identificados y organizados.
Datos semiestructurados
Los datos semiestructurados se sitúan en el medio. Es decir, no se ajustan a la estructura formal de los modelos de datos asociados con bases de datos relacionales u otras formas de tablas de datos, pero contienen etiquetas u otros marcadores para separar elementos y hacer cumplir las jerarquías de registros y campos. Son, por ejemplo, documentos XML, CSV, HTML y datos almacenados en bases de datos NoSQL.
Dependiendo de la estructura de los datos, cada tipo se tratará de manera distinta, a través de unas herramientas específicas. La esencia del Big Data reside en, posteriormente, combinar y configurar unos datos con otros
Las “V” del Big Data
En el año 2001, los analistas de la firma Gartner introdujeron las 3“V” de los datos, como una forma de caracterizar esta tecnología. Se conocen popularmente como las “V” del Big Data, por comenzar todas estas propiedades por dicha letra del alfabeto.
Estas fueron:
- Volumen, Velocidad y Variedad.
Con los grandes avances en el campo de la analítica de datos se han añadido 2”V”s más, pasando a ser 5.
Estas 2 ”V”s son:
- Valor y Veracidad
Hoy en día no hay un consenso sobre cuántas “V” han de ser tomadas en consideración y de hecho la lista de estas se ha ido ampliando, pero en la actualidad las 7”V” del Big Data más extendidas son las anteriores y además:
- Variabilidad y Visión
Es importante profundizar dentro de estas dimensiones del Big Data para comprender mejor el concepto.
Volumen
Esta característica del Big Data se refiere a la cantidad de datos que se manejan.
Tradicionalmente, los datos se han venido generando de forma manual. Ahora tienen fuentes diversas, provienen de máquinas o dispositivos y se recaban de manera automática, y constantemente, por lo que el volumen a analizar es masivo. Estos grandes volúmenes de datos suponen retos técnicos y analíticos importantes para las empresas que los gestionan.
Velocidad
Nos referimos por una parte a la velocidad con la que se crean datos y por otro la velocidad de procesamiento y análisis de estos. No sólo se generan muchos datos y desde muchas fuentes, sino que lo normal es que la velocidad a la que se generan estos datos sea muy alta, incluso en tiempo real.
La velocidad de análisis requerida por la sociedad actual, que busca la inmediatez, es una de las características fundamentales que tienen los datos a gran escala, donde los datos en constante movimiento procesados a tiempo real cobran protagonismo, ejecutando algoritmos cada vez más complejos en menos tiempo.
Además, este gran volumen provoca que los datos queden desfasados rápidamente y que pierdan su valor cuando aparecen otros nuevos.
Las empresas, por lo tanto, deben reaccionar muy rápido para recopilarlos, almacenarlos y procesarlos. El reto para el área de tecnología es almacenar y gestionar grandes cantidades de datos que se generan continuamente. El resto de las áreas de la organización deben convertir esos datos en información útil antes de que pierdan su valor.
Variedad
El concepto de variedad se refiere tanto al distinto origen de los datos como a su diferente estructura.
En cuanto al origen los datos, estos llegan de fuentes muy diferentes. Pueden ser producidos por personas (redes sociales); provenir de fuentes biométricas (una huella dactilar, acceso por reconocimiento facial); pueden ser generados por máquinas (intercambios de datos), etc.
Respecto a la estructura de los datos podemos clasificarlos en estructurados (los tradicionales), no estructurados (videos, mensajes de correo electrónico) y semi. Ello influye en su tratamiento que se hará de manera distinta.
Valor
Esta característica representa el aspecto más relevante del Big Data. El valor que generan los datos, una vez convertidos en información, puede considerarse el aspecto más importante.
Debido a la inmensa cantidad de datos que se debe procesar, se ha de tener especial cuidado en la elección de los datos que realmente serán útiles.
Una buena definición de objetivos y estrategia previa al almacenamiento de datos ahorrará mucho tiempo de cómputo y facilitará la gestión a largo plazo. Por el contrario, si conseguimos muchos datos, pero no extraemos valor de ellos no tendremos nada.
Veracidad
El Big Data debe alimentarse con datos fiables, relevantes y verdaderos. No podremos realizar analíticas útiles si muchos de los datos entrantes provienen de fuentes falsas o con errores en su información. Es muy importante para conseguir unos datos de calidad para llegar a conclusiones precisas.
Esta característica del Big Data probablemente sea la que supone un mayor reto. La gran variedad de los datos provoca que muchos de ellos lleguen incompletos o incorrectos. Algunas de las causas pueden ser que provienen de distintos países o que los proveedores utilizan diferentes formatos. Estos datos deben ser limpiados y analizados, una actividad incesante ya que continuamente se generan otros nuevos.
El Big Data debe eliminar las inexactitudes al recopilar los datos para que las predicciones que se hagan en base a ellos sean lo más acertadas posible, es decir, seleccionar los datos de alta calidad y descartar los que impliquen más imprevisibilidad.
Viabilidad
Se trata de la capacidad que tienen las organizaciones en generar un uso eficaz del gran volumen de datos que manejan.
Los datos son susceptibles de someterse a diferentes interpretaciones. Por eso son necesarios los métodos estadísticos que nos ayuden a interpretarlos correctamente y, así, a emplearlos para hacer predicciones acertadas.
En un entorno tan cambiante como el de los macrodatos, la información varía mucho. Y también han de hacerlo los modelos o tratamientos que se aplican en torno a esta, pues no son fijos en el tiempo y requieren de un control periódico.
Visualización
La visualización trata del modo en el que los datos son presentados.
Los datos requieren unas herramientas de visualización óptimas, con el empleo de gráficas, que nos muestren los resultados del procesamiento de forma clara y nos permitan hacer un análisis, buscar patrones y claves ocultas y tomar decisiones en base a ellos.
Resumen 7V´s
Implementar las 7V del Big Data es vital para poder lograr un óptimo proceso de análisis de datos, por ello se ha de dar a cada una su importancia.
- Volumen: cantidad de datos que se maneja
- Velocidad: de creación y de proceso
- Variedad: distinto origen y estructura
- Valor: utilidad que proporcionan
- Veracidad: fiabilidad de los datos
- Viabilidad: uso eficaz de los datos
- Visualización: representación mediante gráficos.
Infraestructura
El equipamiento utilizado para proyectos Big Data requiere una infraestructura tecnológica específica, integrada por arquitectura hardware y software con dimensión y potencia suficientes y que, actualmente, suelen incluir soluciones de computación en la nube, programas de ordenador de gestión, selección y presentación de los datos, así como los algoritmos que aportan la lógica diferencial del proyecto.
Volumen de información
El término Big-data no se refiere a un tamaño de información específica, es usualmente utilizado cuando se habla en términos de Petabytes y Exabytes de datos.
La información digital se mide en bytes, que es la unidad básica de información. A partir de ésta se construye la escala de medida digital de bytes:
- Kylobyte (KB) = 1024 bytes
- Megabyte (MB) = 10242 bytes
- Gigabyte (GB) = 10243 bytes
- Terabyte (TB) = 10244 bytes
- Petabyte (PB) = 10245 bytes. BIG-DATA
- Exabyte (EB) = 10246 bytes
- Zettabyte (ZB) = 10247 bytes
- Yottabyte (YB) = 10248bytes
La mayoría de los analistas y profesionales actualmente se refieren a Big Data como conjuntos de datos que van desde 30-50 Terabytes a varios Petabytes.
Las grandes compañías como Google suelen hablar de Petabytes y Exabytes de información con mucha frecuencia, debido a la cantidad de datos que manejan. En cambio, si nos ponemos a hablar de pymes, lo común sería hablar de Gigabytes y Terabytes. Es decir, de Small Data.
Aunque el volumen no es lo más importante, es más fácil analizar y extraer conocimiento de 1 terabyte de texto que de 1 gigabyte de imágenes médicas.
Nube
Las tecnologías Big Data actuales resuelven los retos que se van planteando. Las nuevas tecnologías permiten:
- Un menor coste de desarrollo, almacenamiento y procesamiento.
- Una mayor facilidad y velocidad de ingesta de todo tipo de datos (estructurados, semiestructurados y no estructurados), tanto en modo programado por lotes como en tiempo real.
Si a esto añadimos el cambio que introducen los sistemas Big Data en clouds públicas (como Amazon Web Services, Microsoft Azure o Google Cloud), que permiten pasar de un modelo de Inversión a un modelo de Consumo mediante el estricto pago por uso de servicios gestionados de infraestructura y software sin coste de inversión inicial, estamos hablando de una verdadera revolución en la democratización del acceso a la Inteligencia de Negocio.
El abaratamiento del hardware en general también ha contribuido a la adopción del Big Data, el coste de almacenamiento y de proceso ha caído drásticamente y también lo ha hecho el de las comunicaciones, de la misma manera el hecho de que las herramientas y plataformas para el análisis de grandes volúmenes de datos sean Open Source las hace asequibles y accesibles tanto para las grandes empresas, como para las pequeñas.
Software
Ante la continua expansión de los macrodatos, las fuentes y la complejidad de la información no estructurada, las herramientas para su procesamiento deben estar a la par. En este sentido, las bases de datos relacionales tienen que dar paso a soluciones avanzadas que permitan la máxima extracción de conocimiento para usuarios y empresas.
También se requiere software específico sobre todo debido al volumen y la falta de estructura en la información.
Los algoritmos, sin embargo, no pueden considerarse programas de ordenador, puesto que no están expresados en secuencias de instrucciones en lenguaje de programación. Constituyen la secuencia ordenada de operaciones que se pretende realizar para conseguir un resultado concreto o resolver un problema específico asociado a los proyectos Big Data.
El proceso de transformación: de datos a información
De forma muy simplificada, este proceso está compuesto por cuatro fases:
- Captura de información: en esta fase la misión es recopilar los datos que tengamos a nuestra disposición.
- Almacenamiento: dependerá de la estructura de los datos y de su uso futuro.
- Tratamiento: Desde tratamientos sencillos a sistemas predictivos.
- Ejecución: es la puesta en valor de todos los datos recogidos y transformados en información relevante y útil.
Estas fases son procesadas de forma continuada, lo que permite maximizar la información que se obtiene del entorno.
El factor humano entra después: el Big Data no toma las decisiones finales, sino que da información a las personas para que estas puedan tomar resoluciones más satisfactorias. No obstante, la industria 4.0 trabaja desde hace tiempo en cerrar el círculo mediante la aplicación de modelos predictivos y prescriptivos, de manera automatizada.
Gobernanza del Dato
Otro concepto que se escucha cada vez más es el de la Data Governance o Gobernanza del Dato. Se trata del proceso de administrar la disponibilidad, usabilidad, integridad y seguridad de los datos en los sistemas empresariales. Se basa en estándares y políticas de datos internos que también controlan su uso.
La Data Governance garantiza que los datos sean coherentes y fiables y que no se utilicen de forma indebida. A medida que las organizaciones se adaptan a nuevas regulaciones de privacidad de datos y confían cada vez más en el análisis de datos para ayudar a optimizar las operaciones e impulsar la toma de decisiones comerciales, el proceso se vuelve cada vez más crítico.
Un programa de Data Governance bien diseñado incluye un equipo de gobierno, un comité directivo que actúa como órgano de gobierno y un grupo de administradores de datos. Todos trabajan juntos para crear los estándares y políticas de los datos, así como los procedimientos de implementación y cumplimiento que son llevados a cabo principalmente por los administradores de datos. Además de los equipos de gestión de datos y IT, también participan ejecutivos y otros representantes de las operaciones comerciales de una empresa.
Se trata de un componente base en una estrategia de gestión de datos. Sin una buena gobernanza de datos, los nombres de los clientes podrían aparecer de forma diferente en los sistemas de ventas, logística y servicio al cliente, además de complicar los esfuerzos de integración de datos.
Usos del Big Data
Inteligencia de negocio
El análisis de un gran volumen de datos mediante técnicas de Ciencia de Datos o Data Science permite hacer predicciones de comportamiento certeras. Las empresas emplean los resultados, mayoritariamente, para adelantarse a posibles problemas y para detectar qué necesitan sus clientes actuales y sus clientes potenciales.
Al final, la inclusión del Big Data combinado con la Ciencia de Datos deriva en negocios más eficientes, porque podemos adelantarnos y dar las respuestas antes incluso de que lleguen preguntas.
En este contexto, una de las características del Big Data es que es un habilitador tecnológico para la Ciencia de Datos. Es decir, que permite que los modelos de Ciencia de Datos se construyan sobre un volumen virtualmente infinito de datos. Al mismo tiempo, permite procesar y entrenar los modelos de modo mucho más rápido.
De este modo, conseguimos modelos mucho más acertados y en mucho menos tiempo. Esta velocidad mayor redunda en un aspecto clave en Ciencia de Datos e Innovación, como es la aceleración en la Innovación, al poder fallar rápido y con un coste mínimo (Fail Fast).
Como el Big Data está en constante actualización (recibiendo, almacenando y procesando datos en tiempo real), hay un aprendizaje continuo. El volumen de datos con los que se alimentan las predicciones es cada vez mayor, por lo que éstas son cada vez más acertadas y están continuamente supeditadas a posibles cambios.
Limitaciones
Lo importante no son los datos, sino las conclusiones que se obtienen al analizarlos. El Big Data es una herramienta muy útil para detectar correlaciones, especialmente correlaciones sutiles que pueden perderse al analizar conjuntos de datos más pequeños, pero vamos a analizar algunas de sus limitaciones:
- No permite detectar comportamientos individuales o minoritarios que se salgan de la media, sino tendencias y patrones
- Puede detectar correlación, pero no causalidad. El riesgo de correlaciones espurias, es decir, de asociaciones estadísticamente robustas que ocurren por casualidad, aumenta cuanto mayor sea la cantidad de datos que se analice. El Big Data puede sugerir hipótesis e indicar a los investigadores dónde iniciar un análisis, pero para crear modelos siempre será necesario un conocimiento profundo de la materia que sólo poseen los expertos. Ellos y los científicos de datos son imprescindibles para orientar los análisis e interpretar sus resultados. Un problema del Big Data es que los grandes conjuntos de datos contienen una gran cantidad de ruido, es decir, información inútil e irrelevante, y a veces hasta engañosa, que está creciendo a un ritmo más rápido que los datos realmente válidos.
- Los resultados de los análisis tienen un período de validez determinado, debido a que los datos en los que se basan siguen cambiando es necesario reanalizarlos para tener en cuenta dichos cambios.
- No todo se puede predecir, existen sistemas caóticos, fenómenos que no se pueden medir o técnicas como la extrapolación que quedan fuera del alcance del Big Data.
Ventajas
El Big Data es usado por la mayoría de empresas para identificar patrones y tendencias. También para responder preguntas, detectar las necesidades del mercado, las demandas y para obtener información sobre los clientes. Las empresas usan esta información para mejorar sus negocios, entender las decisiones de los clientes, realizar investigaciones, hacer pronósticos y, especialmente, para saber cómo dirigirse a audiencias clave.
El Big Data es enormemente beneficioso si se usa correctamente. Las principales ventajas del Big Data son las siguientes:
- Mejora en la toma de decisiones: Big Data permite predecir de forma certera qué va a pasar y, por tanto, elaborar estrategias cada vez más encauzadas a conseguir los objetivos, tomar las decisiones en base a hechos.
- Reducción de costes: Esas predicciones basadas en la data ayudan a ajustar y optimizar los recursos. Por ejemplo, una empresa puede conocer cuáles son sus puntos fuertes de venta y focalizarse en ellos. Del mismo modo, puede identificar sus puntos débiles y el porqué de estos, y tomar decisiones que cambien las tornas en este sentido. Las grandes tecnologías de datos, como Hadoop y el análisis basado en la nube, aportan importantes ventajas en términos de costes cuando se trata de almacenar grandes cantidades de datos, además de identificar maneras más eficientes de hacer negocios.
- Realimentación en tiempo real: Como los datos son recibidos y procesados en tiempo real, se pueden identificar los cambios de comportamiento mientras están pasando y, por tanto, reajustar las estrategias para que estén constantemente optimizadas.
- Velocidad en la toma de decisiones: De esa constante realimentación deriva también una ventaja importante: la velocidad en la toma de decisiones. No hay que esperar para ver cómo está funcionando una estrategia, por lo que las decisiones se pueden tomar rápidamente y, de nuevo, en base a hechos. Más rápido, mejor toma de decisiones. Con la velocidad de Hadoop y la analítica en memoria, combinada con la capacidad de analizar nuevas fuentes de datos, las empresas pueden analizar la información inmediatamente y tomar decisiones basadas en lo que han aprendido
- Detección de nuevas oportunidades: Con los datos, segmentamos a la población y encontramos nuevas oportunidades. Con la capacidad de medir las necesidades de los clientes y la satisfacción a través de análisis viene el poder de dar a los clientes lo que quieren, nuevos productos y servicios. Con la analítica de Big Data, más empresas están creando nuevos productos para satisfacer las necesidades de los clientes
- Incremento de la productividad y la eficiencia: ya que las herramientas procesan los datos de forma más rápida y facilita a los empleados su trabajo. • Facilita la detección de fraudes y anomalías: permite detectar transacciones erróneas o problemas en las actividades. • Mejora la atención al consumidor y la experiencia del usuario, ya que tenemos más información sobre lo que les gusta y lo que no. • Mejora de la accesibilidad de la información dentro de la empresa: Al digitalizar los datos y habilitar herramientas que facilitan la búsqueda de información se genera una dinámica de trabajo más fluida. • Ventajas competitivas: La extracción y análisis de datos ayuda a determinar el comportamiento de los clientes, y a fijar precios en consecuencia. Como resultado, el Big Data permite, por ejemplo, actualizar, optimizar y afinar inventarios en función de la demanda en tiempo real.
En definitiva, podremos sacar conclusiones con una base más sólida y unos conceptos que se orienten a la toma de decisiones efectivas. Y todo ello, aplicando no únicamente variables del pasado, sino predicciones a futuro mucho más fundamentadas en una base científica que hasta hace unos pocos años.
Desventajas
- Rechazo a su implementación. Cuesta para quienes no entienden muy bien cómo funcionan ciertas innovaciones. Mientras que hay dudas razonables sobre cómo el manejo de macrodatos puede incidir sobre la privacidad, hay que realizar una labor informativa. Su aplicación pretende generar avances importantes y facilitar procesos para su bienestar.
- Problemas con la ciberseguridad. La seguridad en la red representa uno de los mayores desafíos para la administración de grandes cantidades de datos. Las técnicas de protección y los protocolos de almacenamiento deben contrarrestar lo más posible los ataques sofisticados de los hackers. Aunque no se puede garantizar un resguardo 100% efectivo, hace falta fortalecer los sistemas para reducir al mínimo los posibles daños.
- Demasiada acumulación de datos. Puede parecer contradictorio, pero se puede dar un escenario en que una organización se quede sin la capacidad para procesar la ingente generación de datos. Puede ocurrir si no se cuenta con un servicio en la nube o servidores apropiados para este propósito. Además, si no se cuenta con el equipo de especialistas para extraer el valor, la acumulación de información podría obstaculizar y hacer más lentas las labores estratégicas relevantes.
- Cláusulas de protección de datos. Las administraciones deben proteger a sus ciudadanos de cualquier acción que ponga en riesgo su privacidad. Si bien los datos suelen ser anónimos, su recolección puede darse sin conocimiento de causa, transgrediendo derechos fundamentales. Los datos personales no pueden utilizarse con una finalidad diferente a la inicial lo que limita los proyectos del Big Data.
Analizar gran cantidad de datos también conlleva que los estándares de calidad disminuyan. Es complicado seleccionar datos bajo unos criterios de calidad y ofrecerlos con la máxima inmediatez posible ya que se necesita tiempo para poder estructurar los datos obtenidos y desechar aquellos que no valgan.
Estos datos están en constante cambio. Se analizan de forma muy rápida pero la validez de muchos de ellos puede ser muy corta. La solución a este problema la encontramos en la capacidad de procesamiento, cuanto más alto sea, mayor vida útil tendrán. La volatilidad de los datos puede desencadenar errores que trasciendan a la hora de tomar decisiones.
Aplicaciones más relevantes del Big Data
- Marketing. El móvil y otros dispositivos con geolocalización facilitan la activación de avisos cuando la gente se acerca a locales o tiendas comerciales. Como las personas emplean el smartphone para muchas operaciones en Internet, la generación de datos ayuda con la segmentación para campañas, la captación de clientes y las ventas. A medida que los departamentos de marketing tienen más información sobre las ventas pueden identificar y segmentar con una mayor granularidad a los clientes objetivos y así personalizar aún más los contenidos. La puesta a disposición de datos como el flujo en las webs, los clics, las preferencias en Facebook, las codificaciones detalladas de llamadas, los metadatos de los tweets… permiten hallar nuevos conocimientos sobre los patrones de compra y comportamiento de los clientes. Los algoritmos de agrupamiento o análisis clúster son los responsables de esta segmentación y claros beneficiados de los datos masivos.
- Banca. La actividad económica es una de las fuentes más abundantes de información. Cuando se trata de entidades financieras, el enfoque está en ofrecer servicios más seguros, reducir el fraude, seguir las regulaciones y mantener satisfechos a sus clientes. Los neobancos (bancos nativos digitales) son una muestra de cómo estar a la vanguardia en el análisis y gestión acertada de datos.
- Salud. Tanto en la industria farmacéutica en el campo de la investigación de nuevos medicamentos como en el diagnóstico de enfermedades, cada vez es más ampliamente utilizado el Big Data (historial médico, material genético, predicción de reingresos hospitalarios…) para optimizar y probar modelos que mejoren los resultados.
- Turismo. Son empresas que dependen de la satisfacción de sus clientes. Su gran problema siempre ha sido cómo reducir la incidencia de malas experiencias. Recurrir al análisis del Big Data sirve para medir con mayor sentido de la oportunidad lo bueno, anticiparse a lo que podría salir mal y ofrecer servicios con mayor nivel de personalización para conectar más con viajeros o turistas.
- Industria. La combinación Big Data e Internet de las cosas está más presente que nunca en el sector industrial. Mediante la captación de telemetría, KPIs y diferentes métricas, las empresas recrean un panorama más preciso sobre su eficiencia, productividad, seguridad, comunicación y rentabilidad. Todo contribuye a optimizar aspectos clave, como cadena de suministros, stocks, procesos, fallas y mantenimiento preventivo.
- Motores de recomendación: Amazon empezó a utilizar recomendaciones de libros basadas en Big Data y en sustitución de un equipo de críticos editores, el éxito fue rotundo y se patentó. De la misma forma actúa Google con los anuncios recomendados AdSense, Twitter con sus sugerencias, Facebook con los amigos que podrías conocer, Linkedin con los contactos sugeridos. Estas recomendaciones se basan en análisis del perfil de los usuarios y su comportamiento para hacerse “una idea” de lo que quieren. La técnica utilizada es el Filtrado Colaborativo, mediante modelos de co-ocurrencia y algoritmos de machine learning se pueden hacer exitosas recomendaciones en tiempo real no influenciadas por los sesgos que podría tener cualquier experto de carne y hueso.
- Fidelización de clientes: Muchas veces un aumento del número de productos comprados por cliente puede indicar un mayor grado de fidelización , por esto que muchas empresas se esfuerzan para mejorar las ventas, pero muchas veces el análisis de las ventas entre diferentes líneas de negocio choca contra problemas como la heterogeneidad de criterios y datos. Big Data es capaz de tratar de forma unificada estos datos permitiendo analizarlos e identificar patrones que se correlacionen con la pérdida de clientes o con su mayor fidelización y concentrar los esfuerzos en iniciativas eficaces.
- Análisis Social: Hace unos años los científicos de datos de Facebook descubrieron que, si un amigo comparte una foto, o hace clic en un “me gusta” esto anima a que los amigos de este actúen de la misma manera, esto propició por ejemplo que Facebook modificase la página de noticias dando una mayor visibilidad de las acciones de nuestros amigos. Este tipo de patrones de comportamiento serían muy difíciles de hallar sin los medios que proporciona Big Data, en el análisis social se pueden buscar por ejemplo los usuarios que presentan mayor influencia sobre los demás, esto puede ayudar a las empresas a verificar si estos clientes se corresponden o no con los clientes que acaparan más volumen de compras o más variedad y que atributos diferenciales pueden tener.
- Monitorización de redes: Las redes inteligentes son infraestructuras susceptibles de ser analizadas mediante Big Data, las redes de telecomunicaciones, transporte, energía, gas generan grandes cantidades de datos que se pueden beneficiar de forma interna para las empresas al ser explotados proactivamente, detectando por ejemplo posibles cuellos de botella antes de que tengan efectos para los usuarios. Se puede identificar patrones de consumo de electricidad, telefonía, extrapolar poder adquisitivo con consumo, obtener geoposicionamiento de usuarios, correlacionar el tráfico de las calles, carreteras y autopistas con el PIB de una región, etc.
- Análisis de mercados financieros: La búsqueda de indicadores para replicar las cotizaciones es uno de los campos exploratorios del Big Data, relacionar los sentimientos sobre una empresa o sobre sus acciones y correlacionarlo con su cotización es algo posible con la actual cantidad de datos. Mediante algoritmos de aprendizaje y clasificadores Bayesianos se puede hacer un análisis de palabras clave con el propósito de clasificar unos datos (información) dentro de unos criterios. Si además a este modelo le añadimos la posibilidad de analizar datos en tiempo real de las redes sociales como Twitter, entonces tenemos la posibilidad seguir la relación con las cotizaciones de unas acciones en tiempo real. Este tipo de análisis es utilizado por grandes bancos para conocer la opinión pública sobre su empresa, sobre un mercado o sobre la economía.
- Análisis Predictivo: Las entidades financieras utilizan complejos algoritmos de correlación y probabilidad para predecir los futuros cambios en los mercados mediante datos actuales e históricos de los mercados.
- Análisis del riesgo: En el actual entorno cada día más globalizado, hacer una gestión proactiva y continuada del riesgo es clave para el éxito empresarial. Se evalúa la solvencia de un cliente en función de datos de las redes sociales, buscando alertas sobre datos incoherentes, por ejemplo, que un usuario informe en su perfil de la red social Linkedin que está graduado en Harvard pero sin embargo ninguno de los amigos de su red ha estudiado en Harvard puede ser posible pero es poco probable.
- Detección de fraude: El análisis de correlaciones entre múltiples fuentes sin relación puede traer a la luz actividades fraudulentas antes que los métodos de detección tradicionales, esto puede suceder cuando relacionamos datos de compras en los TPV, con comportamiento en la página web del banco o en el smartphone y en las redes sociales, junto con operaciones en cajeros, transacciones con otros bancos o transferencias internacionales SWIFT. Este contexto de datos masivos mejora la detección del fraude de forma notoria.
- Investigación y desarrollo: Cualquier empresa con una dotación importante de personal dedicado a investigación y desarrollo utiliza o puede estar en condiciones de utilizar el potencial de los datos masivos para ayudar a desarrollar nuevos productos o mejorar los existentes. Empresas farmacéuticas, fabricantes de software, empresas químicas, banca, empresas de biotecnología pueden reutilizar los datos históricos y presentes de sus procesos para obtener mejoras de eficiencia en muchos campos.
- Análisis de Juegos: La telemetría que se genera cuando jugamos a los videojuegos es similar al análisis de datos sobre una web, la telemetría permite capturar todas las acciones de un jugador y su comportamiento ante los sucesos de un juego, estos datos permiten modificar la conducta del juego y adaptarla a la del jugador personalizando atributos como la dificultad o el comportamiento de una escena, ofrecer la compra de “vidas”. El conocimiento sobre el comportamiento de los jugadores mediante la telemetría puede llegar a transformar la industria del videojuego a un nuevo escenario donde los juegos se personalicen a medida de los usuarios.
- Trading: Mediante análisis donde se correlaciona contabilidad y el seguimiento de posiciones de trading y el uso de sistemas de trading automatizado se puede desvelar información valiosa para especulación maliciosa que hasta ahora no se podría descubrir con las herramientas tradicionales que no permiten las fuentes de datos heterogéneas y análisis en tiempo real de patrones. Esta información usada de forma ilícita puede contribuir a generar grandes pérdidas a particulares, arruinar empresas, bancos y desestabilizar países.
- Otros campos: Big Data también consigue ganancias de eficiencia en sectores como la sanidad, la agricultura, televisión interactiva, industria automovilística, aviación, genética y telefonía o la traducción automatizada de textos. Un ejemplo es el del fabricante de motores a reacción Rolls Royce, que transformó su negocio con el Big Data, pero no solo con el análisis de los procesos de producción, sino que además introdujo la monitorización continua de todo parque de motores a reacción que tiene hoy en día funcionando en los aviones, esto por ejemplo les permitió detectar problemas de forma preventiva antes de que se produzca una avería.
Casos prácticos de aplicación y éxito empresarial
AMAZON
La compañía de referencia a nivel mundial en lo que a comercio electrónico se refiere basa buena parte de su éxito en conocer de antemano lo que necesitan sus clientes. Así, es muy probable que, si entras en la página de esta empresa, te sugiera artículos que van a ser de gran interés para ti. A través de la inteligencia de datos analizan muchos factores de carácter individual del usuario como sus hábitos de compra o intereses y otros más generales como tendencias del momento o pautas de conducta de otros usuarios que adquirieron productos similares. Juntan todo en la coctelera del Big Data y ofrecen una serie de productos sugeridos o relacionados con compras que el cliente ya ha hecho o se ha planteado hacer.
NETFLIX
La plataforma de servicio de suscripción de vídeo bajo demanda Netflix es una de las empresas que más partido le saca al Big Data. La empresa monitoriza el número de reproducciones que hace cada uno de sus usuarios y analiza sus valoraciones, el soporte que usan (desde dónde acceden a sus contenidos), su ubicación geográfica o el día y hora del visionado. Con toda esta información construye un perfil completo de sus suscriptores para descubrir qué es lo que van a querer ver a continuación en base a patrones predictivos. Así crearon grandes éxitos de audiencia.
T-MOBILE
Esta empresa de telecomunicaciones alemana es un ejemplo de uso de los datos masivos como mejor arma de retención de clientes. Analizando a fondo las conversaciones, reclamaciones y descontentos que sus clientes dejaban en redes sociales, crearon soluciones específicas para cada uno de ellos y consiguieron reducir la fuga de clientes a otras empresas en un 50%, con lo que el retorno de la inversión realizada en Big Data fue compensado con creces.
SPOTIFY
Bajar hasta los datos individualizados más llamativos para lanzar con ellos una campaña global masiva. Eso hizo en Reino Unido la compañía sueca Spotify, que ofrece reproducción de música vía streaming. Su plan consistió en buscar la complicidad del gran público. Y lo consiguieron mostrando curiosidades o rarezas del comportamiento de algunos de sus usuarios que habían detectado a través de los macrodatos. Así, en grandes carteles publicitarios, colocaron anuncios como estos:
- "Querida persona que reprodujo “Sorry” 42 veces en el Día de San Valentín, ¿qué hiciste?"
- "Queridas 3.749 personas que reprodujeron “It’s the end of the world as we know it” el día del Brexit, estamos con vosotros"
NIKE
Los dispositivos electrónicos de su línea NikePlus (relojes inteligentes, pulsómetros, dispositivos con sensores que conectan sus zapatillas con un teléfono…) recogen cantidades masivas de información de millones de usuarios. Información que sirve a la empresa de ropa deportiva estadounidense para buscar la fidelización de los usuarios a través de retos y objetivos que apelan a la capacidad de superación de estos, creando un vínculo con la marca más allá de la venta de material deportivo.
DISNEY
Walt Disney, ha desarrollado un sistema Big Data para la recolección y análisis de datos de la actividad de los visitantes en sus parques temáticos y que ha implementado en su parque de Orlando en Florida. Cada año 100 millones de personas visitan sus parques temáticos usando sus atracciones, comprando los productos Disney ofertados, comiendo en sus restaurantes y durmiendo en sus hoteles. El análisis del inmenso volumen de datos generados proporciona a Disney conocimiento para la toma de decisiones estratégicas, haciéndolos más productivos sus parques temáticos, accesibles y, por tanto, rentables, ofreciendo al visitante aquello que necesita en cada momento.
La recolección de datos se lleva a cabo a través de la pulsera “Magic Band” que sirve como llave de la habitación del hotel y como entrada al parque, incluso puede estar asociada a la tarjeta de crédito para permitir el pago en las tiendas y restaurantes. En cuanto a la información recolectada, gracias a este sistema se obtiene información como:
- Localización en tiempo real
- Historial de compras
- Información personal de los visitantes
- Patrones de uso de las atracciones
El volumen de los datos recolectados puede llegar a los 5 Tb al día. Esto unido a la altísima velocidad de generación de los datos, las posibilidades de análisis en tiempo real y la diversidad de fuentes de datos recolectadas supone un claro ejemplo de Big Data Algunos de los usos que se le dan a los datos recolectados son:
- Análisis de audiencia y segmentación
- Sistema de recomendación
- Análisis de flujos o movimiento de visitantes en el parque
AAPP
Las bondades del Big Data no son solo útiles para el sector empresarial, el Estado puede aprovechar la capacidad el Big Data para tomar mejores decisiones y diseñar mejor las políticas públicas y optimizar los recursos del Estado.
Los diferentes organismos pueden aprovechar esta tecnología para prevenir actividades criminales, mejorar el tráfico, prevención de crisis medioambientales, en materia de seguridad nacional y defensa antiterrorista, etc.
Profundizaremos en algunos ejemplos:
- En la ciudad de Los Ángeles se usa para detectar en qué calles, o qué grupos o individuos son más propensos a cometer delitos y deben ser sometidos a una vigilancia extra.
- Puede ayudar a resolver delitos como las dos explosiones que mataron a tres personas e hirieron a otras muchas en el maratón de Boston de 2013. Menos de 24 horas después de que ocurrieran, el FBI había recogido 10 terabytes de datos que incluían registros de llamadas, mensajes de texto, fotografías y videos procedentes de cámaras de vigilancia. La investigación concluyó cuatro días después con la muerte de uno de los sospechosos y la detención del segundo, en parte gracias al análisis de todos estos datos y de la colaboración ciudadana, que contribuyó con pistas, fotografías y videos.
- El Big Data también puede ser de gran ayuda en el seguimiento de epidemias como demostró Google en 2009, descubriendo que existía una estrecha relación entre el número de personas que realizaba búsquedas relacionadas con la gripe y las personas que realmente sufrían síntomas gripales. En la actualidad, esta herramienta, conocida como Google Flu Trends, ofrece datos sobre la actividad de la gripe en diferentes países y regiones de todo el mundo.
- El Big Data se ha convertido en los últimos años en una herramienta muy útil dentro de los procesos electorales. Permiten seguir el sentimiento de los electores y la percepción que tienen los votantes sobre los candidatos en cada momento, haciendo que las campañas se basen en datos de una forma mucho más dinámica que antaño. De hecho, la forma de hacer campaña cambia: ya no son tan decisivos los grandes mítines, sino un acercamiento mucho más segmentado que tiende a individualizar a los votantes para conseguir llegar con un mensaje más personal, cercano y directo a cada uno de ellos. Uno de los grandes ejemplos del uso de la inteligencia de datos en campaña electoral con éxito es la de Obama para lograr su segundo mandato como presidente de los Estados Unidos de América y la campaña de Trump, muy polémica.
El Big Data y el gobierno abierto
Los gobiernos poseen ingentes cantidades de datos sobre los ciudadanos, empresas, organizaciones, turistas… Algunos de los datos que poseen los gobiernos podrían ser: datos personales, datos catastrales, datos médicos, datos de la renta, datos sobre nuestros vehículos, datos sobre nuestros estudios, datos sobre las cuentas anuales de las empresas, datos sobre nuestros trabajos, propiedades, litigios, infracciones o multas, viajes al extranjero, datos de transporte público, datos sobre economía nacional, datos sobre transacciones, datos sobre votaciones, datos sobre presupuestos, datos sobre mercados regulados…
No podemos hablar de los grandes datos sin hablar también de los datos abiertos, que se define como “cualquier contenido, información o datos que las personas pueden usar, reusar y redistribuir sin ninguna restricción legal, tecnológica o social” Deben estar disponibles de forma gratuita o a un coste mínimo en un formato que facilite su uso, y deben poder ser utilizados sin discriminación de personas, grupos o aplicaciones.
Su análisis puede beneficiar a las empresas, las organizaciones y el público en general, porque les permite crear nuevos negocios, detectar patrones y tendencias y tomar decisiones informadas.
Hasta ahora eran explotados de forma interna por los gobiernos, pero ahora estos datos están siendo liberados de forma agregada para que cualquier pueda explotarlos como conocimiento, con iniciativas altruistas o empresariales para sacar el mayor rendimiento de estos. Estas iniciativas de datos abiertos u open están empezándose a promoverse por parte de gobiernos tanto estatales como locales.
En España, la administración, a través de la Iniciativa Aporta y el portal datos.gob.es, promovido por el Ministerio de Asuntos Económicos y Transformación Digital y la Entidad Pública Empresarial Red.es, promociona la apertura y reutilización de la información pública y el desarrollo de servicios avanzados basados en datos.
Ejemplos de open data se pueden hallar en numerosas instituciones públicas:
Por ello, el gobierno tiene la responsabilidad de transformar en datos abiertos aquellos subconjuntos que puedan ser más beneficiosos para los ciudadanos. Así queda reflejado en la Ley de Transparencia.
Ejemplos uso Big Data en las AAPP
Lucha contra el fraude en la Seguridad Social
En la Tesorería General de la Seguridad Social se han diseñado planes integrales de lucha contra el fraude, aplicando la tecnología Big Data a los procesos. Para ello, se ha dotado de las herramientas tecnológicas más avanzadas en inteligencia artificial en pro del tratamiento analítico de los datos, incorporando en sus equipos de trabajo a científicos de datos, quienes definen patrones de comportamiento y establecen modelos predictivos. EL Plan integral de lucha contra el fraude permite aprovechar el valor de la ingente cantidad de datos acumulados para establecer controles en materia de afiliación, cotización y recaudación del Sistema.
Con el empleo de nuevas tecnologías de analítica avanzada, la Seguridad Social refuerza su compromiso por la innovación, desarrollando modelos que permiten nuevas áreas de trabajo y garantizan mayor calidad y optimización de los resultados.
Verificación de facturas en la Agencia Tributaria
El uso del Big Data le es útil a este organismo para poder comprobar la legalidad de las facturas registradas por los trabajadores autónomos.
Hacienda dispone cada cuatro días de toda la información relativa a las facturas emitidas y las recibidas de las empresas y autónomos. Si el organismo detecta una irregularidad en las cuentas, pasa a una segunda fase que consiste en cruzar dichos datos con los movimientos bancarios de la persona o de la empresa.
En ese momento Hacienda puede requerir al profesional información sobre los ingresos o transacciones realizadas. Adicionalmente, puede recurrir a información de terceros para evitar posibles fisuras en el cotejo de la información.
Algunos de los sectores más afectados por estas comprobaciones son los que suelen generar mas operaciones en efectivo: comercio tradicional, hostelería, mensajería o mudanzas. Lo mismo sucede con las plataformas de comercio electrónico, donde es más sencillo realizar el cotejo, ya que la mayoría de los pagos son electrónicos.
Profesiones asociadas
Tal es el auge de esta industria que la agenda de transformación digital del Gobierno incluye como eje estratégico 9 (https://portal.mineco.gob.es/es-es/ministerio/estrategias/Paginas/00_Espana_Digital.aspx España Digital 2026]):
Economía del dato e inteligencia artificial: “Transitar hacia una economía del dato, garantizando la seguridad y privacidad y aprovechando las oportunidades que ofrece la Inteligencia Artificial con el objetivo de que, al menos, el 25 % de empresas usen Inteligencia Artificial y Big Data dentro de cinco años”.
Debido a la transformación digital, las compañías necesitan expertos que sepan gestionar y analizar grandes cantidades de datos.
El perfil de experto en Big Data se ha convertido en la profesión de moda, siendo de los empleos más demandados en la actualidad. Gracias a su auge, la carrera de matemáticas ha disparado su empleabilidad hasta el 100% y la nota de corte para entrar en la facultad se ha situado entre las más altas.
Se trata de personas con amplios conocimientos técnicos, que pueden suponer, desde las tareas más elevadas, las del denominado data scientist o científico de datos, cuya labor consiste en la concepción y desarrollo de algoritmos que aportan valor añadido diferencial al proyecto de Big Data en cuestión, hasta la mera tarea de depuración de datos, pasando por la definición de objetivos y finalidades del proyecto o por la elección de las mejores técnicas de combinación o de anonimización de datos. En segundo lugar, el proceso de tratamiento de datos y la implementación de un proyecto Big Data requiere personas con un gran conocimiento del negocio y del sector en el que el proyecto vaya a operar.
El Big Data es fundamental para las empresas, organismos públicos e instituciones del mundo actual. Capacitarse en este campo resulta esencial para aquellas personas que quieren desempeñarse en una de las profesiones con más futuro. La realidad es que en la actualidad no hay suficientes expertos en el sector como para cubrir esta necesidad.
Desafíos en el mundo del Big Data
Muchas empresas se quedan estancadas en la etapa inicial de sus proyectos de Big Data. Esto se debe a que no son conscientes de los grandes desafíos que plantea ni están equipados para ello.
Uno de los motivos principales es la falta de comprensión y formación en el ámbito. Probablemente, la mayoría de los empleados no especialistas en este campo no sepan qué son los datos, cómo se procesan o almacenan.
Otro de los desafíos que plantea es saber cómo almacenar correctamente estos datos. La cantidad de datos que se acumulan en los centros y bases de datos de las empresas aumenta rápidamente y a medida que lo hace se vuelve más difícil de procesar.
En cuanto a las herramientas, las organizaciones a menudo se confunden al seleccionar la mejor para el análisis y almacenamiento de Big Data. Si no se escoge la adecuada, acabará suponiendo un desperdicio de dinero, tiempo, esfuerzo y horas de trabajo.
Importancia del Big Data. Conclusiones
Big Data sirve para el manejo de grandes volúmenes de información, utilizado principalmente por grandes empresas, pero gracias a las nuevas tecnologías y su fácil acceso podrá ser utilizado por cualquier empresa o institución.
Las compañías en todo el mundo se enfrentan al problema de una creciente generación de datos que vienen en diferentes formatos, múltiples fuentes y con una velocidad incremental, Big Data resuelve este problema y lo convierte en una oportunidad para descubrir tendencias del mercado, patrones ocultos del negocio, preferencias de los clientes y correlaciones que no se habían tenido en cuenta.
En múltiples ámbitos con objetivos muy diversos, el análisis de datos masivos es una herramienta fundamental, con especial foco en el ámbito empresarial. Así, el aumento de ventas de Amazon a través de su acierto en la venta cruzada, la elección del lanzamiento de nuevos contenidos de Netflix, la retención de clientes de T-Mobile, la provocación de un sentimiento en el receptor de un anuncio de Spotify o la fidelización de Nike que hemos puesto entre los ejemplos, muestran muchas facetas distintas e importantes de la relación de las empresas con sus clientes que trascienden los niveles conocidos hasta ahora.
Dentro del ámbito de las organizaciones y empresas, el Big Data ofrece un marco propicio para una transformación digital que se considera cada vez más necesaria. La gestión de datos masivos cuenta con múltiples aplicaciones cuyo desarrollo empieza a consolidarse. En un entorno exigente y competitivo, su aplicación puede marcar la diferencia.
Como parte de la evolución de esta tecnología, los expertos en este campo se han vuelto uno de los perfiles más demandados de la industria, aunque todavía no hay tantos expertos como demanda de éstos.
El Big Data seguirá expandiendo su abanico de posibilidades; es evidente el aumento progresivo de datos e información, y con el aumento de la información más posibilidades de hacer mejores análisis de datos.
Es también lógico, que las empresas empiecen a utilizar más profesionales en Big Data en la medida que este se convierte en una herramienta eficiente para el análisis de datos masivos, y a partir de allí tomar mejores decisiones.
En la sociedad actual, también llamada sociedad del conocimiento, el Big Data abre las posibilidades para obtener información, a partir del análisis de datos, algunos llaman al Big Data el nuevo petróleo, por las potencialidades en ahorro de procesos y toma de decisiones acertadas y eficaces.
Por lo tanto, en la medida en que las empresas se adapten a estos avances tecnológicos lograran enfocar la toma de decisiones, por ejemplo, estudiar los clientes y sus prácticas de una manera detallada, a partir de allí diseñar la mejor estrategia comercial, para ello cada empresa deberá tomarse la tarea de cultivar la cultura de las TIC, investigar, cualificar y diseñar su estrategia Big Data según sus necesidades e intenciones.
Podemos aventurarnos a decir que el futuro del Big Data es más prometedor que nunca. Su adopción se hace cada vez más necesaria y esto se refleja en las tendencias que veremos durante los próximos años.
Acelerar la digitalización de las empresas es uno de los diez ejes estratégicos de la Agenda Digital 2025, siendo un elemento clave para el aumento de su productividad, su competitividad y su rentabilidad futura.
Ello sumado al retorno de la inversión que se produce, una vez que la tecnología se está abaratando, y el número de profesionales expertos se va incrementando, se espera un buen futuro en este campo.
Bibliografía y Referencias
- Fundamentos de Big Data. INAP.
- Big Data For Dummies. Judith Hurwitz. Alan Nugent. Fern Halper. Marcia Kaufman. Editorial: For Dummies.
- Del Cloud Computing al Big Data: visión introductoria para jóvenes emprendedores. Jordi Torres i Viñals. Editorial UOC.
- Economía de los datos. Riqueza 4.0. Emilio Ontiveros. Verónica López Sabater. Editorial Ariel. Fundación Telefónica.
- Desarrollo de historia con datos
- Data Storytelling, Using visualization to share the human impact of numbers. Jock Mackinlay, PhD, Robert Kosara, PhD, Michelle Wallace
- Big Data: La revolución de los datos masivos. Viktor Mayer-Schönberger. Kenneth Cukier. Editorial: Turner.
- Las 10 mejores herramientas de Big Data 2023
- Uso de inteligencia artificial y big data en las empresas españolas