探索中国CIO人才现状 | 第四季调研报告
SQL Server+Hadoop 变身大数据解决方案
2013-07-03  作者:企业网 

  在数据库市场中,微软的SQLServer是最受关注的产品之一。在数据库知识网站DB-Engines每月公布的数据库流行度排行榜中,SQLServer几乎稳占第二名的位置。但从这个榜单每月的变化中也可以看出,大量NoSQL数据库的排名不断上升,已经开始威胁到传统数据库的地位。


  “以不变应万变”不再是大数据时代应有的策略,老牌数据库厂商在保持传统市场领先的基础上,不断拓展新市场,微软就是其中的一个代表。微软的改变最早是为了向Bing提供高质量的搜索结果,这与Google的情况类似,互联网行业总是最早面临大数据挑战的。


  微软端到端的大数据解决方案可以总结为SQLServer、WindowsAzure和Hadoop,用微软自己的话说就是数据管理、数据扩充和洞察力。下面笔者将按照自下而上的顺序盘点微软大数据解决方案的具体内容:


  一、数据管理


  在微软的大数据解决方案中,数据管理是最底层和最基础的一环。灵活的数据管理层,可以支持所有数据类型,包括结构化、半结构化和非结构化的静态或动态数据。在数据管理层中主要包括三款产品:SQLServer、SQLServer并行数据仓库和HadooponWindows。


  针对不同的数据类型,微软提供了不同的解决方案。具体来说,针对结构化数据可以使用SQLServer和SQLServer并行数据仓库处理;非结构化数据可以使用WindowsAzure和WindowsServer上基于Hadoop的发行版本处理;而流数据可以使用SQLServerStreamInsight管理,并提供接近实时的分析。


  1、SQLServer。去年发布的SQLServer2012针对大数据做了很多改进,其中最重要的就是全面支持Hadoop,这也是SQLServer2012与SQLServer2008最重要的区别之一。今年年底即将正式发布的SQLServer2014中,SQLServer进一步针对大数据加入内存数据库功能,从硬件角度加速数据的处理,也被看为是针对大数据的改进。


  2、SQLServer并行数据仓库。并行数据仓库(ParallelDataWarehouseAppliance,简称PDW)是在SQLServer2008R2中推出的新产品,目前已经成为微软主要的数据仓库产品,并将于今年发布基于SQLServer2012的新款并行数据仓库一体机。SQLServer并行数据仓库采取的是大规模并行处理(MPP)架构,与传统的单机版SQLServer存在着根本上的不同,它将多种先进的数据存储与处理技术结合为一体,是微软大数据战略的重要组成部分。


  3、HadooponWindows。微软同时在WindowsAzure平台和WindowsServer上提供Hadoop,把Hadoop的高性能、高可扩展与微软产品易用、易部署的传统优势融合到一起,形成完整的大数据解决方案。微软大数据解决方案还通过简单的部署以及与ActiveDirectory和SystemCenter等组件的集成,为Hadoop提供了Windows的易用性和可管理性。凭借WindowsAzure上基于Hadoop的服务,微软为其大数据解决方案在云端提供了灵活性。


  二、数据扩充


  社交媒体的兴起给企业带来独特的计划,以获取更多商业价值,最终实现竞争优势。微软大数据解决方案将数据和模型与公用的数据和服务(包括Twitter、Facebook和LinkedIn等社交媒体网站)相结合,从而能够实现突破性的发现。在数据扩充层,微软提供的最重要的平台是WindowsAzureMarketplace。


  WindowsAzureMarketplace是一个在线市场,用于购买和销售完成的软件即服务(SaaS)应用程序和高级数据集。WindowsAzureMarketplace可以帮助将寻求基于云的创新解决方案的公司与开发了准备使用的解决方案的合作伙伴连接到一起,使客户能够使用WindowsAzureMarketplace上的应用程序和挖掘算法来发现隐藏的模式。


  ·通过WindowsAzureMarketplace进行共享和协作:微软大数据解决方案可让客户通过WindowsAzureMarketplace共享数据并发现新的洞察力,WindowsAzureMarketplace可通过开放数据协议(OData)展露数百种来自微软和第三方的应用程序和数据挖掘算法。


  ·与社交媒体集成:微软大数据解决方案可让客户通过来自社交媒体网站(例如Twitter和Facebook)的公用数据来扩展他们的分析。微软的一款代号为“SocialAnalytics”的基于云的项目允许企业将社交媒体信息与业务应用程序相集成。


  ·借助Hadoop执行高级分析:微软大数据解决方案支持传统的BI以及高级分析(例如数据挖掘和图形挖掘),从而可让客户从他们所有的数据中发现新价值。HiveODBCDriver可让客户使用SQLServer数据挖掘工具执行预测分析。微软还将支持Mahout等其他高级分析工具,以及使用C++、C#、Python、Ruby和Pearl编写的挖掘算法。


  三、洞察力


  企业收集、存储和处理数据,最终目的还是要获得洞察力。企业需要能够轻松处理和分析PB级的新数据,而不用担心建立复杂的分布式存储和计算集群,并且要能够随着需求的增加实现缩放。微软大数据解决方案可让客户用熟悉的BI工具从他们的结构化和非结构化数据中获得可执行的洞察力。


  从洞察力的层面,微软提供了两款主要的产品,分别是OfficePowerpivot和SharePointPowerView。PowerPivot和PowerView工具,能够帮助企业快速的从数据中发现信息,从而解决业务问题。其中,PowerPivot可以用来设计数据模型,PowerView可以用来设计可视化报表,报表还可以发布到SharePoint平台上。最终用户能够根据自己业务视角及要求设计数据模型并展示出来,充分利用数据和前台界面的力量,满足业务需求。


  ·使用熟悉的工具分析Hadoop数据:微软可让用户利用Excel的Hive组件在熟悉的Excel环境中与Hadoop中的非结构化数据进行交互并加以分析。


  ·通过任何数据获得深入的洞察力:企业可以用熟悉的BI工具(例如MicrosoftSQLServerAnalysisServices(SSAS)、PowerPivot和PowerView)通过HiveOpenDatabaseConnectivity(ODBC)Driver来分析Hadoop中的非结构化数据。企业还可以用SQLServer2012上的PowerPivot和PowerView对关系型数据采用自助服务的BI产品。


  ·通过简化的编程驱动洞察力:微软通过与.NET和新的JavaScript库集成简化了Hadoop的编程。开发人员可以在JavaScript中使用新的JavaScript库来轻松编写MapReduce程序,然后通过简单的浏览器来部署他们的JavaScript代码。


  小结


  微软的大数据解决方案从本质上看还是原有SQLServer和Office产品的升级,最大的亮点是在SQLServer、WindowsServer和WindowsAzure中都集成了Hadoop功能,使Hadoop成为连接这三者之间的桥梁。微软的大数据解决方案产品丰富、功能齐全,但相对缺乏创新。在用户看来,微软最大的特色就是产品的易用性和界面的友好性,这也是用户选择微软的主要原因。