百度集团副总裁吴甜解读跨模态大模型技术创新,发布AI作画神器文心·一格

这篇具有很好参考价值的文章主要介绍了百度集团副总裁吴甜解读跨模态大模型技术创新,发布AI作画神器文心·一格。希望对大家有所帮助。如果存在错误或未考虑完全的地方,请大家不吝赐教,您也可以点击"举报违法"按钮提交疑问。

百度集团副总裁吴甜解读跨模态大模型技术创新,发布AI作画神器文心·一格

8月19日,中国图象图形大会CCIG 2022在成都召开。百度集团副总裁、深度学习技术及应用国家工程研究中心副主任吴甜在会上发表《跨模态大模型技术创新与实践》主题演讲,并正式发布AI艺术和创意辅助平台——文心·一格,这是百度依托飞桨、文心大模型的技术创新推出的“AI作画”首款产品。

百度集团副总裁吴甜解读跨模态大模型技术创新,发布AI作画神器文心·一格

百度集团副总裁、深度学习技术及应用国家工程研究中心副主任吴甜

为艺术创想插上科技羽翼

人人都能成为“艺术家”

人学习作画一般得从基本功练起,大体上包括线条、色彩、明暗、形体、结构、透视、构图和空间。要想画得出众,除了日积月累勤奋练习,还需要一些天赋,以及对世界的精细观察和创作者独特的创想。这让大部分人只能当画作的观赏者而非创作者。但是,随着深度学习、大模型等技术的发展,AI能够在极短的时间内“创造”出不同风格的画作,大幅降低了作画的门槛,让人人都能成为“艺术家”。

文心·一格是基于文心大模型的文生图系统实现的产品化创新。在文心·一格官网,用户只需输入自己的创想文字,并选择期望的画作风格,即可快速获取由一格生成的相应画作。官网资料显示,文心·一格现已支持国风、油画、水彩、水粉、动漫、写实等十余种不同风格高清画作的生成,还支持不同的画幅选择。

  • 文心·一格官网地址:yige.baidu.com

百度集团副总裁吴甜解读跨模态大模型技术创新,发布AI作画神器文心·一格

文心·一格创作的艺术画

百度集团副总裁吴甜解读跨模态大模型技术创新,发布AI作画神器文心·一格

文心·一格创作的创意画

文心·一格面向的用户人群非常广泛。它既能启发画师、设计师、艺术家等专业视觉内容创作者的灵感,辅助其进行艺术创作,还能为媒体、作者等文字内容创作者提供高质量、高效率的配图。此外,文心·一格更是为大众用户提供了一个零门槛绘画创作平台,让每个人都能展现个性化格调,享受艺术创作的乐趣。

百度集团副总裁吴甜解读跨模态大模型技术创新,发布AI作画神器文心·一格

文心·一格

背后的跨模态大模型技术与系统创新

吴甜表示,数据的井喷式增长、算力的持续突破、算法的持续创新为人工智能带来新机遇,预训练大模型凭借优越的泛化性、通用性和应用效果,成为人工智能发展的重要方向。跨模态大模型是在技术发展和产业实践中孕育而出的,也是百度文心知识增强大模型面向产业应用持续创新及建设的重要方向。

面对日益增长的内容创作需要,如何准确理解用户需求,进而精准刻画并满足多样化风格、高质量生成的要求是技术要解决的关键挑战。文心知识增强跨模态理解大模型在模型创新方面,提出基于多视角对比学习的ERNIE-ViL 2.0,在预训练过程能够同时学习模态间和模态内的多种关联性,提升“图像”和“文本”跨模态语义匹配效果。知识增强跨模态图文生成大模型ERNIE-ViLG,将“文生成图”和“图生成文”任务融合到同一个模型进行端到端学习,从而增强文本和图像的跨模态语义对齐。在此次CCIG 2022会上,吴甜还分享了ERNIE-ViLG文图生成算法的升级,通过渐进式扩散模型,生成空间由小及大、生成轮廓由粗到细,同时根据生成阶段自动选择最优生成网络,文本生成图像的效果取得进一步提升。

新技术在产业实践中应用并创造出价值必须要足够实用化。因此,百度基于文心大模型进行了系统创新,研发了支持AI作画的文生图系统,提供了从用户需求理解到满足的全流程解决方案。首先,基于知识的Prompt工程,理解用户需求并在此基础上丰富语义细节,降低用户输入描述成本。其次,基于扩散生成算法实现创意写实与恢弘构图的艺术画作生成。最后,基于跨模态匹配大模型进行生成画作的结果排序,自动选出语义与美观度最佳的画作。

从技术创新到系统创新再到产品化创新,这一体系性的创新得益于飞桨产业级深度学习平台的夯实有力支撑。飞桨的端到端自适应分布式训练技术、4D混合并行策略、对异构硬件的自适应并行支持,锤炼出框架与算力、算法相结合三位一体的大模型训练优势。飞桨的自动模型压缩工具、自适应分布式推理技术,更是大幅节约了机器资源,让大模型的部署更加高效、便捷,能真正落地应用。

吴甜认为,新技术应用于场景,需要从基础算法、技术系统、工程平台多方面同时创新,文心·一格就是依托于多项新技术综合创新的产品。

除了推出一格这样的AI艺术和创意辅助平台,文心跨模态大模型还为广大开发者、科技爱好者提供了飞桨开源工具和API服务能力,满足开发者灵活探索等需求。对灵活性需求更高的开发者,可以使用飞桨的开源工具PaddleHub基于文图生成开源算法极简开发,并完成模型的管理和一键预测。对便捷性需求更高的开发者,可以使用文心ERNIE-ViLG API极速获得沉浸式文图生成大模型的技术体验,更可灵活方便、高效地实现产品集成。

  • 文心ERNIE-ViLG API地址:

https://wenxin.baidu.com/moduleApi/ernieVilg

据了解,为了帮助更多行业用户清晰了解、轻松应用基于大模型技术的AIGC能力,百度飞桨文心大模型已在8月开设AIGC系列公开课,课程深入浅出、体系全面并配套丰富的实践资源。

让机器具备跨越文本、图像等多种模态的复杂场景理解与生成能力,是人工智能的重要目标之一,也是数字时代科技与产业深度融合创新,催生新业态新模式,加快产业智能化升级的新动能。人工智能在艺术领域的学习与创作能力正以蓬勃之势不断刷新我们的认知,同时也让公众对科技与艺术及文化的融合创新有了更大的想象空间。文心大模型正在成为推动AIGC(人工智能生成内容)发展的新引擎,基于文心大模型的AIGC将会带来创新性的探索,并赋能到广泛的行业领域。

课程预告

业界首个《基于大模型的AI生成能力应用》专题直播课正在火热进行中,其中AI作画专场将于8月24日(下周三)20:30直播开课,带你进一步了解如何基于文心大模型生成丰富多彩的绘画作品。更多课程内容详情如下,欢迎大家扫码报名学习交流。

关注【飞桨PaddlePaddle】公众号

获取更多技术内容~文章来源地址https://www.toymoban.com/news/detail-493296.html

到了这里,关于百度集团副总裁吴甜解读跨模态大模型技术创新,发布AI作画神器文心·一格的文章就介绍完了。如果您还想了解更多内容,请在右上角搜索TOY模板网以前的文章或继续浏览下面的相关文章,希望大家以后多多支持TOY模板网!

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处: 如若内容造成侵权/违法违规/事实不符,请点击违法举报进行投诉反馈,一经查实,立即删除!

领支付宝红包 赞助服务器费用

相关文章

  • 多模态大语言模型 LlaVA 论文解读:Visual Instruction Tuning

    代码:https://github.com/haotian-liu/LLaVA 在这篇论文中,作者首次尝试使用 纯语言 GPT-4 生成多模态语言图像指令遵循数据 (insruction-following data)。 通过对此类生成数据进行指令调整,推出了 大型语言和视觉助手 (Large Language and Vision Assistant, LLaVA )。一种端到端训练的大型多

    2024年02月11日
    浏览(28)
  • 百度商业AI技术创新大赛启动-63万元奖金!

    随着生成式AI在全球范围的热议,AIGC前沿技术也在快速迭代,正如百度CEO李彦宏所说“ 人工智能发生了方向性改变,从辨别式AI走向生成式AI,生成式AI会带来极大的效率提升 ”。而这一领域的发展,将推动AI产品应用深化,极有可能在内容创作、客户服务等领域带来颠覆性变

    2024年02月07日
    浏览(43)
  • 首站中科院!百度商业AI技术创新大赛开启巡回宣讲

    近日,百度商业AI技术创新大赛正式启动,并于5月18日起开启高校巡回宣讲。 宣讲会首站落地中国科学院大学,中国科学院大学人工智能学院副院长、教授、博士生导师肖俊教授,百度商业研发主任架构师焦学武,百度商业资深工程师吕显赫、胡明清等人作为嘉宾出席了本次

    2024年02月06日
    浏览(25)
  • 首届百度商业AI技术创新大赛启动 点燃AIGC革新“星火”

    随着生成式AI在全球范围的热议,AIGC前沿技术也在快速迭代,正如百度CEO李彦宏所说 “人工智能发生了方向性改变,从辨别式AI走向生成式AI,生成式AI会带来极大的效率提升” 。而这一领域的发展,将推动AI产品应用深化,极有可能在内容创作、客户服务等领域带来颠覆性变

    2024年02月09日
    浏览(39)
  • [方案实操|数据技术]数据要素十大创新模式(1):基于区块链的多模态数据交易服务平台

    “  区块链以其公开共享、去中心化、不可篡改、可追溯和不可抵赖等优势,吸引了包括金融业、医疗业和政府部门等众多利益相关方的极大兴趣,被认为是解决数据安全交换问题的合适方案。 ” 武汉东湖大数据科技股份有限公司凭借 基于区块链的多模态数据交易服务平台

    2024年04月17日
    浏览(31)
  • 百度Apollo:引领自动驾驶技术的创新与突破

    随着科技的迅猛发展,自动驾驶技术正成为未来交通领域的重要发展方向。在这个领域中,百度Apollo作为中国领先的自动驾驶平台,以其卓越的创新能力和开放合作精神,在推动自动驾驶技术的发展上有着举足轻重的地位。本文将从技术创新、开放合作、生态建设和安全可靠

    2024年02月11日
    浏览(42)
  • 低代码平台解读:“低代码+PaaS”的技术创新实践

    数字化转型已经成为必然趋势,几乎所有传统行业都喊出了数字化转型的口号。但在数字化转型中,很多企业面临着成本高、周期长的难题。低代码是其中一种破解难题的方式,如今的低代码已经是企业数字化的核心引擎。 低代码平台越来越多,如何做好平台选型也成为了令

    2024年02月11日
    浏览(37)
  • 百度商业AI 技术创新大赛赛道二:AIGC推理性能优化TOP10之经验分享

    朋友们,AIGC性能优化大赛已经结束了,看新闻很多队员已经完成了答辩和领奖环节,我根据内幕人了解到,比赛的最终代码及结果是不会分享出来的,因为办比赛的目的就是吸引最优秀的代码然后给公司节省自己开发的成本,相当于外包出去了,应该是不会公开的。抱着技术

    2024年02月11日
    浏览(66)
  • “科创中国”青百会轮值主席吴甜:以大语言模型为代表的AI将引发产业变革

    8月1日,“科创中国”青年百人会(后文简称青百会)联合百度举办“青·创·汇”高端对话,围绕人工智能技术创新与产业发展交流研讨,同时正式成立“科创中国”青年百人会女性工作委员会。该委员会将鼓励更多女性投身科技创新事业,为女性科技工作者提供展示交流平

    2024年02月14日
    浏览(27)
  • 钉钉副总裁李智勇:AI超级助理,提升大模型时代生产力

    微软比尔盖茨此前曾预言:“五年内,每个人都将拥有AI私人助理Agent,Agent将颠覆软件行业 。” 近日以来,在GPT store正式上线点爆情绪之后,无论国内外,Agent都是创业圈里炙手可热的新贵。一场关于Agent创业比拼大赛,拉开了帷幕。 目前,国外出现了几种做AI Agent的方向。一

    2024年01月24日
    浏览(36)

觉得文章有用就打赏一下文章作者

支付宝扫一扫打赏

博客赞助

微信扫一扫打赏

请作者喝杯咖啡吧~博客赞助

支付宝扫一扫领取红包,优惠每天领

二维码1

领取红包

二维码2

领红包