|
|
51CTO旗下网站
|
|
移动端

腾讯AI Lab正式开源业内大规模多标签图像数据集

腾讯 AI Lab 宣布正式开源“Tencent ML-Images”项目,该项目由多标签图像数据集 ML-Images,以及业内目前同类深度学习模型中精度最高的深度残差网络 ResNet-101 构成。

作者:腾讯AI实验室来源:腾讯科技|2018-10-19 12:16

腾讯 AI Lab 宣布正式开源“Tencent ML-Images”项目,该项目由多标签图像数据集 ML-Images,以及业内目前同类深度学习模型中精度***的深度残差网络 ResNet-101 构成。

该项目的开源,是腾讯 AI Lab 在计算机视觉领域所累积的基础能力的一次释放,为人工智能领域的科研人员和工程师提供了充足的高质量训练数据,及简单易用、性能强大的深度学习模型,促进人工智能行业共同发展。

项目访问地址:

https://github.com/Tencent/tencent-ml-images

腾讯 AI Lab 此次公布的图像数据集 ML-Images,包含了 1800 万图像和 1.1 万多种常见物体类别,在业内已公开的多标签图像数据集中规模***,足以满足一般科研机构及中小企业的使用场景。此外,基于 ML-Images 训练得到的深度残差网络 ResNet-101,具有优异的视觉表示能力和泛化性能,在当前业内同类模型中精度***,将为包括图像、视频等在内的视觉任务提供强大支撑,并助力图像分类、物体检测、物体跟踪、语义分割等技术水平的提升。

本次正式开源,其主要内容包括:

1、ML-Images 数据集的全部图像 URLs,以及相应的类别标注。因原始图像版权问题,此次开源将不直接提供原始图像,用户可利用腾讯 AI Lab 提供的下载代码和 URLs 自行下载图像。

2、ML-Images 数据集的详细介绍。包括图像来源、图像数量、类别数量、类别的语义标签体系、标注方法,以及图像的标注数量等统计量。

3、完整的代码和模型。腾讯 AI Lab 提供的代码涵盖从图像下载和图像预处理,到基于 ML-Images 的预训练和基于 ImageNet 的迁移学习,再到基于训练所得模型的图像特征提取的完整流程。项目提供了基于小数据集的训练示例,以方便用户快速体验该训练流程。项目还提供了具有极高精度的 ResNet-101 模型(在单标签基准数据集 ImageNet 的验证集上的 top-1 精度为 80.73%)。用户可根据自身需求,随意选用该项目的代码或模型。

以深度神经网络为典型代表的深度学习技术已经在很多领域充分展现出其优异的能力,尤其是计算机视觉领域,包括图像和视频的分类、理解和生成等重要任务。然而,要充分发挥出深度学习的视觉表示能力,必须建立在充足的高质量训练数据、优秀的模型结构和模型训练方法,以及强大的的计算资源等基础能力之上。

各大科技公司都非常重视人工智能基础能力的建设,都建立了仅面向其内部的大型图像数据集,例如谷歌的 JFT-300M 和 Facebook 的 Instagram 数据集。但这些数据集及其训练得到的模型都没有公开,对于一般的科研机构和中小企业来说,这些人工智能基础能力有着非常高的门槛。

当前业内公开的***规模的多标签图像数据集是谷歌公司的 Open Images, 包含 900 万图像和 6000 多物体类别。腾讯 AI Lab 此次开源的 ML-Images 数据集包括 1800 万图像和 1.1 万多常见物体类别,或将成为新的行业基准数据集。

此外,基于 ML-Images 训练得到的 ResNet-101 模型,具有优异的视觉表示能力和泛化性能。通过迁移学习,该模型在 ImageNet 验证集上取得了 80.73% 的 top-1 分类精度,超过谷歌同类模型(迁移学习模式)的精度,且值得注意的是,ML-Images 的规模仅为 JFT-300M 的约1/17。这充分说明了 ML-Images 的高质量和训练方法的有效性。详细对比如下表。

注:微软 ResNet-101 模型为非迁移学习模式下训练得到,即 1.2M 预训练图像为原始数据集 ImageNet 的图像。

腾讯 AI Lab 此次开源的“Tencent ML-Images”项目,展现了腾讯在人工智能基础能力建设方面的努力,以及希望通过基础能力的开放促进行业共同发展的愿景。

“Tencent ML-Images”项目的深度学习模型,目前已在腾讯多项业务中发挥重要作用,如“天天快报”的图像质量评价与推荐功能,其后台测试的日调用量已达 1000 万次。

如下图所示,天天快报新闻封面图像的质量得到明显提高。

左图为优化前,右图为优化后

此外,腾讯 AI Lab 团队还将基于 Tencent ML-Images 的 ResNet-101 模型迁移到很多其他视觉任务,包括图像物体检测,图像语义分割,视频物体分割,视频物体跟踪等。这些视觉迁移任务进一步验证了该模型的强大视觉表示能力和优异的泛化性能。“Tencent ML-Images”项目未来还将在更多视觉相关的产品中发挥重要作用。

自 2016 年腾讯***在 GitHub 上发布开源项目(https://github.com/Tencent),目前已累积开源覆盖人工智能、移动开发、小程序等领域的 57 个项目。为进一步贡献开源社区,腾讯相继加入 Hyperledger、LF Networking 和开放网络基金会,并成为 LF 深度学习基金会首要创始成员及 Linux 基金会白金会员。作为腾讯“开放”战略在技术领域的体现,腾讯开源将继续对内推动技术研发向共享、复用和开源迈进,向外释放腾讯研发实力,为国内外开源社区提供技术支持,注入研发活力。

【编辑推荐】

  1. 谁“杀死”了大数据创业者?
  2. 程序员和产品经理的宿命之战,从“买包中华烟”说起_技术栈微信半月刊第27期
  3. 刚刚Gartner发布了2019年十大战略性技术趋势:自主设备、增强分析、AI驱动的开发等
  4. Java后端技术栈,到底如何深入学习?
  5. 腾讯开源框架 Omi 更新,全面拥抱 Web Components
【责任编辑:张燕妮 TEL:(010)68476606】

点赞 0
分享:
大家都在看
猜你喜欢

订阅专栏+更多

16招轻松掌握PPT技巧

16招轻松掌握PPT技巧

GET职场加薪技能
共16章 | 晒书包

289人订阅学习

20个局域网建设改造案例

20个局域网建设改造案例

网络搭建技巧
共20章 | 捷哥CCIE

645人订阅学习

WOT2019全球人工智能技术峰会

WOT2019全球人工智能技术峰会

通用技术、应用领域、企业赋能三大章节,13大技术专场,60+国内外一线人工智能精英大咖站台,分享人工智能的平台工具、算法模型、语音视觉等技术主题,助力人工智能落地。
共50章 | WOT峰会

0人订阅学习

读 书 +更多

精通Spring 2.x——企业应用开发详解

本书深刻揭示了Spring的技术内幕,对IoC、AOP、事务管理等根基性的技术进行了深度的挖掘。读者阅读本书后,不但可以熟练使用Spring的各项功...

订阅51CTO邮刊

点击这里查看样刊

订阅51CTO邮刊

51CTO服务号

51CTO播客