<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>analytique - RiskInsight</title>
	<atom:link href="https://www.riskinsight-wavestone.com/tag/analytique/feed/" rel="self" type="application/rss+xml" />
	<link>https://www.riskinsight-wavestone.com/tag/analytique/</link>
	<description>Le blog cybersécurité des consultants Wavestone</description>
	<lastBuildDate>Wed, 21 Jan 2015 08:58:59 +0000</lastBuildDate>
	<language>fr-FR</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	

<image>
	<url>https://www.riskinsight-wavestone.com/wp-content/uploads/2024/02/Blogs-2024_RI-39x39.png</url>
	<title>analytique - RiskInsight</title>
	<link>https://www.riskinsight-wavestone.com/tag/analytique/</link>
	<width>32</width>
	<height>32</height>
</image> 
	<item>
		<title>Quel est le paysage technologique du Big Data ?</title>
		<link>https://www.riskinsight-wavestone.com/2012/02/quest-ce-que-le-paysage-technologique-du-big-data/</link>
		
		<dc:creator><![CDATA[Matthieu Millet]]></dc:creator>
		<pubDate>Fri, 03 Feb 2012 09:26:04 +0000</pubDate>
				<category><![CDATA[Métiers - Stratégie & projets IT]]></category>
		<category><![CDATA[analytique]]></category>
		<category><![CDATA[Big Data]]></category>
		<category><![CDATA[Business Intelligence]]></category>
		<category><![CDATA[Enterprise Datawarehouse]]></category>
		<category><![CDATA[Hadoop]]></category>
		<category><![CDATA[mapReduce]]></category>
		<category><![CDATA[stockage]]></category>
		<category><![CDATA[technologies]]></category>
		<guid isPermaLink="false">http://www.solucominsight.fr/?p=1261</guid>

					<description><![CDATA[<p>[Article rédigé en collaboration avec  Lise Gasnier] MMI (Mathieu Millet) : Le premier élément structurant dans le contexte Big Data est le socle de “stockage” des données. L’approche historique est celle des offres de DatawareHouse, qui ont évolué, sous forme...</p>
<p>Cet article <a href="https://www.riskinsight-wavestone.com/2012/02/quest-ce-que-le-paysage-technologique-du-big-data/">Quel est le paysage technologique du Big Data ?</a> est apparu en premier sur <a href="https://www.riskinsight-wavestone.com">RiskInsight</a>.</p>
]]></description>
										<content:encoded><![CDATA[<p><em><em>[Article rédigé en collaboration avec  Lise Gasnier]</em></em></p>
<p><strong>MMI</strong> (Mathieu Millet)<strong> : Le premier élément structurant dans le contexte Big Data est le socle de “<em>stockage”</em> des données.</strong></p>
<p>L’approche historique est celle des offres de DatawareHouse, qui ont évolué, sous forme d’<em>appliance</em> notamment, pour supporter de plus grandes quantités de données et faire porter par le « stockage » une capacité de traitement étendue (principe de <em>PushDown</em>). On retrouve les offres de fournisseurs tels que TeraData (leader historique sur le marché), Oracle avec ExaData, IBM/Netezza/Informix ou encore, EMC/Greenplum ou HP/Vertica.</p>
<p>Ces solutions ont toutes en commun un modèle de données fortement structuré (type, table, schéma, …) et le langage de requête SQL.</p>
<p>L’approche en rupture est celle proposée par Google, avec la publication de son Livre Blanc Big Table. Cette approche consiste en 2 grands principes. Tout d’abord, il s’agit de reprendre les principes de scalabilité (horizontale) des clusters de calcul scientifique (HPC).Puis, on peut se permettre de s&rsquo;affranchir de certaines contraintes inhérentes à un usage transactionnel des bases de données relationnelles traditionnelles, et qui ne sont plus strictement nécessaires pour les usages analytiques, telles que les principes d’ACIDité (Atomicité, Cohérence, Isolation et Durabilité), le langage SQL (Not-Only SQL, NoSQL) et la contrainte de Cohérence (immédiate) du théorème CAP<a title="" href="http://www.solucominsight.fr/wp-admin/post-new.php#_ftn1">[1]</a> de Brewer .</p>
<p>Cependant, pour simplifier la mise en œuvre d’une telle solution  et rendre l’infrastructure simple, scalable (à plusieurs centaines de nœuds), avec du matériel à bas coût (donc sans inclure de réseau faible latence, type InfiniBand ou même sans réseau de stockage spécifique), le framework de “gestion” d’un tel cluster est obligé de contraindre fortement l’organisation et la manière de développer. Les principes de Map Reduce<a title="" href="http://www.solucominsight.fr/wp-admin/post-new.php#_ftn2">[2]</a> (toujours décrits dans le Libre Blanc de Google) répondent à ces contraintes.</p>
<p>La solution la plus emblématique de cette approche est Hadoop et son écosystème. Développé initialement par Yahoo, maintenant supporté par la fondation Apache, Hadoop implémente un système de Fichiers massivement Distribués (HDFS) et un moteur Map Reduce. Hadoop est épaulé par tout un écosystème afin d’étendre son champ fonctionnel, avec par exemple HBase (base de données de type NoSQL) ou encore Hive (entrepôt de données disposant d’un langage de requêtage <em>à la SQL</em>).</p>
<p>Hadoop a tellement le vent en poupe que presque tous les acteurs du DatawareHouse (Oracle, Microsoft, IBM, Teradata,…) ou de l’analytique (SAS, R, Micro Strategy, &#8230;) ont maintenant annoncé des solutions autour de ce nouvel écosystème.</p>
<p><strong>LGA </strong>(Lise Gasnier) : <strong>La finalité du stockage est d&rsquo;extraire l&rsquo;information utile des données. L&rsquo;analyse est naturellement l&rsquo;autre volet majeur du paysage technologique du Big data.</strong></p>
<p>Dans ce domaine, l&rsquo;innovation porte sur l&rsquo;intégration des solutions d&rsquo;analyse à celles de stockage pour éviter les mouvements des données. Mathieu a cité Hive pour sa compatibilité avec Hadoop. Citons également Greenplum un dérivé de Postgres qui repose sur une architecture distribuée sur un cluster de machines. Cette tendance à l&rsquo;interaction se traduit aussi par le rapprochement d&rsquo;acteurs issus des deux mondes: Revolution Analytics (BI) et IBM Netezza,par exemple,  sont partenaires depuis début 2011.</p>
<p>Une approche banalisée de ce rapprochement entre traitements et données est celle des grilles de données tels que Oracle Coherence, Terracotta ou Gigaspaces XAP. Elles offrent la capacité de distribuer les données sur des nœuds de calcul. Elles se trouvent donc à la jonction entre clusters de traitements distribués et bases de données mémoire.</p>
<p>Ces dernières, en économisant les accès aux disques, permettent d’utiliser des approches analytiques classiques tout en garantissant les performances à mesure que la complexité des requêtes et leur volume évolue. Même si les produits (comme les appliances analytiques SAP HANA et Kognitio WX2) ne sont pas en mesure, aujourd’hui, de gérer les pétaoctets du Big Data, il faudra être attentif à l’innovation sur ce marché en croissance car on observe une convergence de différentes technologies au sein des solutions proposées par les éditeurs.</p>
<p>Toujours sur le plan de l’analyse, on assiste à la diffusion et à l’outillage des techniques analytiques, notamment par le recours à des méthodes issues de l&rsquo;intelligence artificielle de type Machine Learning et Natural Language Processing.</p>
<p>Le Big data met aussi l&rsquo;accent sur l&rsquo;importance de restituer efficacement les résultats d&rsquo;analyse et d&rsquo;accroître l&rsquo;interactivité entre utilisateurs et données. Ainsi, des produits comme Tableau (de Tableau Software) proposent des visualisations graphiques innovantes.</p>
<p><strong>MMI : Enfin, pour pouvoir analyser ces données que l’on aura stockées, il ne faut pas oublier le processus d’acquisition et de chargement de ces mêmes données.</strong></p>
<div><br clear="all" /></p>
<hr align="left" size="1" width="33%" />
<div>
<p><a title="" href="http://www.solucominsight.fr/wp-admin/post-new.php#_ftnref1">[1]</a> Le théorème CAP explique que pour un système réparti (tel qu’une base de données répartie sur plusieurs ordinateurs), il n’est pas possible d’assurer simultanément : Cohérence, Disponibilité (<em>Availability</em>), résistance au Partitionnement (<em>Partition Tolerence</em>).</p>
</div>
<div>
<p><a title="" href="http://www.solucominsight.fr/wp-admin/post-new.php#_ftnref2">[2]</a> L’approche MapReduce consiste à réaliser les différents traitements selon 2 tâches (qui peuvent se répéter) :</p>
<ul>
<li>Une fonction <em>Map</em>, massivement distribuable sur différents noeuds de calcul, qui associe un “couple (clef, valeur)” en entrée et un (ou plusieurs) “couple(s) (clef,valeur)” en sortie. La fonction Map ne traitant qu’un unique couple “à la fois”, il n’y a pas de problème de distribution des traitements.</li>
<li>Une fonction <em>Reduce</em>, qui regroupe toutes les réponses et les rassemble en une liste unique de valeur, pour finaliser le traitement..</li>
</ul>
<p>&nbsp;</p>
<p>Lire aussi les articles :</p>
<p><a href="http://www.solucominsight.fr/2012/01/qu%E2%80%99est-ce-que-le-big-data/" target="_blank">Qu&rsquo;est-ce que le Big Data</a></p>
<p><a href="http://www.solucominsight.fr/2012/02/comment-faire-face-a-l%E2%80%99emergence-du-phenomene-big-data/">Comment faire face à l&rsquo;émergence du phénomène Big Data</a></p>
</div>
</div>
<p>Cet article <a href="https://www.riskinsight-wavestone.com/2012/02/quest-ce-que-le-paysage-technologique-du-big-data/">Quel est le paysage technologique du Big Data ?</a> est apparu en premier sur <a href="https://www.riskinsight-wavestone.com">RiskInsight</a>.</p>
]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>Qu’est-ce que le Big Data ?</title>
		<link>https://www.riskinsight-wavestone.com/2012/01/quest-ce-que-le-big-data/</link>
		
		<dc:creator><![CDATA[Lise Gasnier]]></dc:creator>
		<pubDate>Mon, 30 Jan 2012 08:39:46 +0000</pubDate>
				<category><![CDATA[Métiers - Stratégie & projets IT]]></category>
		<category><![CDATA[analytique]]></category>
		<category><![CDATA[Big Data]]></category>
		<category><![CDATA[définition]]></category>
		<category><![CDATA[données]]></category>
		<category><![CDATA[non structurées]]></category>
		<category><![CDATA[pétaoctets]]></category>
		<category><![CDATA[stockage]]></category>
		<category><![CDATA[vélocité]]></category>
		<guid isPermaLink="false">http://www.solucominsight.fr/?p=1237</guid>

					<description><![CDATA[<p>[Article rédigé en collaboration avec  Mathieu Millet] LGA (Lise Gasnier) : C’est le big buzz de 2011 qui ne manquera pas de faire du bruit cette année encore! Il désigne les ensembles de données aux volumétrie et complexité telles qu’il...</p>
<p>Cet article <a href="https://www.riskinsight-wavestone.com/2012/01/quest-ce-que-le-big-data/">Qu’est-ce que le Big Data ?</a> est apparu en premier sur <a href="https://www.riskinsight-wavestone.com">RiskInsight</a>.</p>
]]></description>
										<content:encoded><![CDATA[<p><em>[Article rédigé en collaboration avec  Mathieu Millet]</em></p>
<p><strong>LGA </strong>(Lise Gasnier)<strong> :</strong> C’est le big buzz de 2011 qui ne manquera pas de faire du bruit cette année encore! Il désigne les ensembles de données aux volumétrie et complexité telles qu’il faut repenser les moyens de leur gestion. Le volume de ces données se mesure désormais en pétaoctets (10<sup>15</sup> octets). Et, par complexité, nous entendons une ou plusieurs caractéristiques parmi lesquelles :</p>
<ul>
<li>croissance rapide et soutenue,</li>
<li>formats hétérogènes,</li>
<li>peu ou pas de structuration (comme par exemple pour les images, vidéos, pages web et emails),</li>
<li>des sources variées.</li>
</ul>
<p>Les Big data sont par exemple des :</p>
<ul>
<li>données transactionnelles (commandes, paiements etc.).</li>
<li>logs,</li>
<li>clickstreams,</li>
<li>événements géolocalisés,</li>
<li>contenus de réseaux sociaux,</li>
<li>données comportementales,</li>
<li>relevés de compteurs intelligents,</li>
<li>appels au service client.</li>
</ul>
<p>Par extension, le terme désigne, au-delà des données, les moyens humains ou technologiques extraordinaires mis en œuvre pour les traiter.</p>
<p><strong> </strong></p>
<p><strong>MMI </strong>(Mathieu Millet)<strong> : </strong>L’ensemble de la chaîne de traitement technique de ces données se voit remaniée : capture, stockage, analyse et transformation en informations pertinentes et enfin, restitution.</p>
<p>Processus métiers et finalité des traitements n’ont rien de nouveau (pilotage opérationnel, aide à la décision, analyse clientèle et comportementale, optimisation de processus…). Par contre, le volume, la nature et le rythme d’acquisition en données, décrit par Lise, tout comme la volonté d’accélérer ces traitements provoquent un vrai changement de paradigmes technologiques et organisationnels.</p>
<p>Ainsi, certaines pratiques ne sont plus envisageables comme la recopie intégrale de données entre différentes applications susceptibles d’utiliser ces données. Également, de nouvelles pratiques sont à employer afin de tirer parti de l’écosystème Big Data ; par exemple : mettre en œuvre une plus grande coopération/interaction entre les solutions d’analyse et l’<em>entrepôt de stockage</em> afin de bénéficier des performances (I/O mais également CPU) de ce dernier.</p>
<p>&nbsp;</p>
<p><strong>LGA : </strong>La problématique de gestion des gros volumes de données ne date pas d’hier. Depuis bientôt dix ans, elle est même centrale aux métiers de la recherche scientifique, de la finance et de l’indexation web. Mais, la conjoncture actuelle en a fait un sujet de tout premier plan :</p>
<ul>
<li>La production de données augmente drastiquement, par l’action des individus tout autant que celles des organisations. Ainsi, les analystes d’IDC relèvent que le volume du contenu numérique mondial a atteint 2.7 zettaoctets (soit 2.7*10<sup>21</sup> octets), avec une augmentation de 48% en 2011. Ils estiment par ailleurs, qu’en 2012, 90% de l’information sera sans structure (voir le rapport complet gratuitement à cet endroit : <a href="http://www.idc.com/getdoc.jsp?containerId=231720">http://www.idc.com/getdoc.jsp?containerId=231720)</a>.</li>
<li>Des solutions techniques ont émergé, dont certaines libres, comme la plus emblématique : Hadoop et son écosystème (que nous évoquerons plus en détail dans un prochain article). Elles rendent possible et accessible la refonte technologique nécessaire, évoquée par Mathieu.</li>
</ul>
<p>Les entreprises réfléchissent donc aujourd’hui, tous secteurs confondus, à tirer un avantage concurrentiel de leurs gisements de données ou de ceux publics (web, open data). Des premiers “business cases” (optimisation du marketing numérique, détection et prévention des fraudes, analyse des réseaux sociaux et des relations&#8230;) démontrent déjà que de nouveaux indicateurs, de nouveaux leviers de  valeurs  sont à portée de main. Mais, les questions demeurent nombreuses : il faut définir précisément les besoins et cadrer les transformations stratégiques, organisationnelles, techniques et légales de ce “passage à l’échelle”. D’où le buzz, qu’alimentent par ailleurs les acteurs du paysage technologique!</p>
<p>&nbsp;</p>
<p>Lire aussi les articles :</p>
<p><a href="http://www.solucominsight.fr/2012/02/quest-ce-que-le-paysage-technologique-du-big-data/" target="_blank">Quel est le paysage du Big Data</a></p>
<p><a href="http://www.solucominsight.fr/2012/02/comment-faire-face-a-l%E2%80%99emergence-du-phenomene-big-data/">Comment faire face à l&rsquo;émergence du phénomène Big Data</a></p>
<p>Cet article <a href="https://www.riskinsight-wavestone.com/2012/01/quest-ce-que-le-big-data/">Qu’est-ce que le Big Data ?</a> est apparu en premier sur <a href="https://www.riskinsight-wavestone.com">RiskInsight</a>.</p>
]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
