大数据+AI meetup 2020第二季·上海
Show
活动报名已满,请关注当日直播间:
直播间地址:https://developer.aliyun.com/live/245461
2020年11月1日 10:00-18:00,由阿里云计算平台事业部与阿里云开发者社区联合主办的 大数据+AI meetup 2020第二季·上海 将在杨浦区政学路77号InnoSpace旗舰一楼IPOclub 举办 !
线上同样精彩,本次会议仍然保留直播,为不能到现场的同学同步精彩分享,速来预约直播,不错过当日推送。
直播间地址:https://developer.aliyun.com/live/245461
【大咖阵容】
《更低延时和更高吞吐量的流存储, Pravega性能详解》
嘉宾:
雷璐,DellEMC, Senior Principal Engineer, 在分布式对象存储和流存储产品上有着10年+设计架构经验。现主要专注于流式系统上数据全文检索方向-Pravega Search.
演讲简介:
流式系统要求在只追加(Append-Only)数据结构之上实现高效的读写访问以及较低的端到端延迟。随着流式数据容量的不断增长,流式系统面临的挑战也越来越大,不仅要能够以低延迟处理工作负载,还要以高吞吐量容纳大容量数据。Pravega作为开源流式存储系统,不仅实现了读写路径的低延迟和高吞吐,同时还可以达到弹性、持久性和一致性的要求。更重要是,今天公用云提供的标准硬件让不同开源产品之间的性能对比变的透明和公平。在这个主题中,我们会选取流系统几个标准场景去比较Pravega, Kafka, and Pulsar性能,并且会公开所有技术细节
《基于spark的高性能向量化查询引擎基于spark的高性能向量化查询引擎》
嘉宾:
范文臣,Databricks 开源组技术主管,Apache Spark Committer、PMC成员,Spark开源社区核心开发之一。
演讲简介:
随着IO硬件性能的不断提升,越来越多的查询引擎针对CPU进行优化。本次演讲将向大家分享Databricks在构建向量化查询引擎过程中的一些实践经验。
《数据湖存储架构选型》
嘉宾简介:
郑锴,花名铁杰,阿里巴巴高级技术专家,Apache Hadoop PMC。深耕分布式系统开发和开源大数据多年,目前专注于在阿里云上研发业界领先的 Hadoop/Spark 大数据平台和数据湖解决方案产品。
演讲简介:
数据湖技术在大数据领域炙手可热,随着在云上的广泛部署和应用,其业务价值逐渐获得业界共识。传统的大数据平台如何基于数据湖架构进行平台升级,享受新一轮的技术发展红利?这个分享着重讨论数据湖架构和应用在存储上面临的主要挑战,方案选型和最佳实践。
《Flink + Hologres 云原生实时数仓最佳实践》
嘉宾简介:
刘一鸣,花名合一, 阿里云高级产品专家,主要负责Hologres产品的演进和商业化。在大数据、数据仓库、开源软件行业有10年以上工作经验,Apache Kylin PMC & Committer。
演讲简介:
Hologres是基于云原生能力设计的,支持高吞吐数据实时写入、实时分析的分布式数据仓库产品,与Flink的实时加工能力相结合,满足实时数仓的建设、运维需求。本次将分享Hologres设计理念和架构体系,解析大数据如何支持分析服务一体化,分享实时数仓建设实践案例。
《Iceberg+Flink 应用场景深度分析》
嘉宾:
李劲松,花名之信,阿里巴巴技术专家,Apache Flink&Iceberg Committer,长期专注于流批一体的计算与数仓架构。
演讲简介:
1.Iceberg及数据湖介绍
2.构建数仓Data Pipeline
3.数仓实时化
流批统一
Backfilling: 流作业Bootstrap
4.构建CDC Pipeline
《万亿级消息队列Kafka在滴滴的实践》
嘉宾:
张亮,滴滴大数据架构部,高级技术专家, 2014年加入滴滴,主持构建过任务调度系统、监控系统、日志服务、实时计算、同步中心等平台设计与研发工作,目前在负责LogAgent、Kafka 、ElasticSearch、OLAP的引擎建设工作,具有丰富的高并发、高吞吐场景的架构设计与研发经验。
演讲简介:
Kafka作为滴滴大数据消息队列,每天承载万亿级消息的生产与消费,面对60GB/S峰值流量,在集群稳定性,运维友好性上遇到了很大的挑战,本次演讲主要分享滴滴在Kafka高可用建设上在架构与引擎上的针对性优化;在Kafka可观察性与运维友好性上在Kafka云平台的建设实践!
1、Topic资源隔离差,流量突增、回溯消费,影响集群稳定性,如何应对?
2、Kafka运维友好性性与可观察性不足,社区Kafka-Manager,产品化、平台化缺失,如何应对?
《Kafka practice at bilibili》
嘉宾:
张辰安,bilibili 资深开发工程师
演讲简介:
介绍在大流量下kafka的痛点及解决方案
目录:
1、介绍kafka在b站的规模,架构
2、介绍在大流量下遇到的痛点
2.1、如何解决写入抖动问题
2.2、为何需要修改kafka限流功能
2.3、kafka在多盘上的问题及解决方案
2.4、物理隔离任务优先级的方案
3、bilibili kafka治理平台
4、一些展望
《Apache Pulsar + Flink:统一批流处理最佳实践》
嘉宾:
赵建云,StreamNative 工程师,Apache Pulsar Contributor
演讲简介:
Apache Flink 是一个框架和分布式处理引擎,用于在无边界和有边界数据流上进行有状态的计算。尽管 Apache Flink 支持统一的批处理和流计算,但大多数流式存储系统均不支持它。 Apache Pulsar 的独特设计与当前正在开发的一些新功能相结合,解决了这个问题。在本演讲中,我们会介绍批流融合带来的新特性,例如并行批处理读取使用批处理工作负载、Key_Shared订阅等,分享批流融合处理的最佳实践案例。
《Elasticsearch 大数据应用能力探查》
嘉宾:
李猛,上海力萌信息科技有限公司 数据技术专家。Elastic Stack深度用户,Elastic官方认证工程师,国内首批21人通过者之一。2012年接触Elasticsearch,对Elastic Stack技术栈开发、架构、运维、源码、算法等方面有深入体验,实践过多种Elastic Stack项目,主导过数据规模PB级以上的项目,包括大数据分析领域,复杂业务系统领域,日志采集处理分析领域,系统指标监控领域等。业余为企业和个人提供Elastic Stack咨询培训以及调优实施。
演讲简介:
1.全面介绍Elastic Stack自有大数据的处理能力、应用场景案例。
2.了解Elasticsearch与其它大数据产品混合能力、应用场景案例。
行程小助手:
73coffee位于上海地铁10号线江湾体育场地铁站,10号口步行604米处。
前楼有地下停车场10元/小时
加入钉钉群了解更多活动信息
李猛
Elastic Stack深度用户,Elastic官方认证工程师,国内首批21人通过者之一。2012年接触Elasticsearch,对Elastic Stack技术栈开发、架构、运维、源码、算法等方面有深入体验,实践过多种Elastic Stack项目,主导过数据规模PB级以上的项目,包括大数据分析领域,复杂业务系统领域,日志采集处理分析领域,系统指标监控领域等。业余为企业和个人提供Elastic Stack咨询培训以及调优实施。
张亮
张亮 滴滴大数据架构部,高级技术专家, 2014年加入滴滴,主持构建过任务调度系统、监控系统、日志服务、实时计算、同步中心等平台设计与研发工作,目前在负责LogAgent、Kafka 、ElasticSearch、OLAP的引擎建设工作,具有丰富的高并发、高吞吐场景的架构设计与研发经验。
张辰安
张辰安,Bilibili资深开发工程师
刘一鸣
刘一鸣,花名合一,阿里云高级产品专家,主要负责Hologres产品的演进和商业化。在大数据、数据仓库、开源软件行业有10年以上工作经验,Apache Kylin PMC & Committer。
李劲松
李劲松,花名之信,阿里巴巴技术专家,Apache Flink&Iceberg Committer,长期专注于流批一体的计算与数仓架构。
赵建云
赵建云,StreamNative 工程师,Apache Pulsar Contributor
郑锴
郑锴,花名铁杰,阿里巴巴高级技术专家,Apache Hadoop PMC。深耕分布式系统开发和开源大数据多年,目前专注于在阿里云上研发业界领先的 Hadoop/Spark 大数据平台和数据湖解决方案产品。
范文臣
范文臣,Databricks 开源组技术主管,Apache Spark Committer、PMC成员,Spark开源社区核心开发之一。
雷璐
雷璐,DellEMC, Senior Principal Engineer, 在分布式对象存储和流存储产品上有着10年+设计架构经验。现主要专注于流式系统上数据全文检索方向-Pravega Search。
(2个月前)
(2个月前)
(2个月前)
(2个月前)
(2个月前)
(2个月前)
大数据领域前沿技术分享与交流,这里不止有技术干货、学习心得、企业实践、社区活动,还有未来。