新闻中心

论文插图也能自动生成了,用到了扩散模型,还被ICLR接收

2023-06-27
浏览次数:
返回列表

生成式 AI 已经风靡了人工智能社区,无论是个人还是企业,都开始热衷于创建相关的模态转换应用,比如文生图、文生视频、文生音乐等等。

最近呢,来自 ServiceNow Research、LIVIA 等科研机构的几位研究者尝试基于文本描述生成论文中的图表。为此,他们提出了一种 FigGen 的新方法,相关论文还被 ICLR 2025 收录为了 Tiny Paper。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

论文插图也能自动生成了,用到了扩散模型,还被ICLR接收图片

论文地址:https://arxiv.org/pdf/2306.00800.pdf

也许有人会问了,生成论文中的图表有什么难的呢?这样做对于科研又有哪些帮助呢?

科研图表生成有助于以简洁易懂的方式传播研究结果,而自动生成图表可以为研究者带来很多优势,比如节省时间和精力,不用花大力气从头开始设计图表。此外设计出具有视觉吸引力且易理解的图表能使更多的人访问论文。

然而生成图表也面临一些挑战,它需要表示框、箭头、文本等离散组件之间的复杂关系。与生成自然图像不同,论文图表中的概念可能有不同的表示形式,需要细粒度的理解,例如生成一个神经网络图会涉及到高方差的不适定问题。

因此,本文研究者在一个论文图表对数据集上训练了一个生成式模型,捕获图表组件与论文中对应文本之间的关系。这就需要处理不同长度和高技术性文本描述、不同图表样式、图像长宽比以及文本渲染字体、大小和方向问题。

在具体实现过程中,研究者受到了最近文本到图像成果的启发,利用扩散模型来生成图表,提出了一种从文本描述生成科研图表的潜在扩散模型 ——FigGen。

这个扩散模型有哪些独到之处呢?我们接着往下看细节。

模型与方法

研究者从头开始训练了一个潜在扩散模型。

首先学习一个图像自动编码器,用来将图像映射为压缩的潜在表示。图像编码器使用 KL 损失和 OCR 感知损失。调节所用的文本编码器在该扩散模型的训练中端到端进行学习。下表 3 为图像自动编码器架构的详细参数。

然后,该扩散模型直接在潜在空间中进行交互,执行数据损坏的前向调度,同时学习利用时间和文本条件去噪 U-Net 来恢复该过程。

论文插图也能自动生成了,用到了扩散模型,还被ICLR接收

至于数据集,研究者使用了 Paper2Fig100k,它由论文中的图表文本对组成,包含了 81,194 个训练样本和 21,259 个验证样本。下图 1 为 Paper2Fig100k 测试集中使用文本描述生成的图表示例。

论文插图也能自动生成了,用到了扩散模型,还被ICLR接收

模型细节

首先是图像编码器。第一阶段,图像自动编码器学习一个从像素空间到压缩潜在表示的映射,使扩散模型训练更快。图像编码器还需要学习将潜在图像映射回像素空间,同时不丢失图表重要细节(如文本渲染质量)。

为此,研究者定义了一个具有瓶颈的卷积编解码器,在因子 f=8 时对图像进行下采样。编码器经过训练可以最小化具有高斯分布的 KL 损失、VGG 感知损失和 OCR 感知损失。

其次是文本编码器。研究者发现通用文本编码器不太适合生成图表任务。因此他们定义了一个在扩散过程中从头开始训练的 Bert transformer,其中使用大小为 512 的嵌入通道,这也是调节 U-Net 的跨注意力层的嵌入大小。研究者还探索了不同设置下(8、32 和 128)的 transformer 层数量的变化。

最后是潜在扩散模型。下表 2 展示了 U-Net 的网络架构。研究者在感知上等效的图像潜在表示中执行扩散过程,其中该图像的输入大小被压缩到了 64x64x4,使扩散模型更快。他们定义了 1,000 个扩散步骤和线性噪声调度。

论文插图也能自动生成了,用到了扩散模型,还被ICLR接收

训练细节

Pippit AI Pippit AI

CapCut推出的AI创意内容生成工具

Pippit AI 133 查看详情 Pippit AI

为了训练图像自动编码器,研究者使用了一个 Adam 优化器,它的有效批大小为 4 个样本、学习率为 4.5e−6,期间使用了 4 个 12GB 的英伟达 V100 显卡。为了实现训练稳定性,他们在 50k 次迭代中 warmup 模型,而不使用判别器。

对于训练潜在扩散模型,研究者也使用 Adam 优化器,它的有效批大小为 32,学习率为 1e−4。在 Paper2Fig100k 数据集上训练该模型时,他们用到了 8 块 80GB 的英伟达 A100 显卡。

实验结果

在生成过程中,研究者采用了具有 200 步的 DDIM 采样器,并且为每个模型生成了 12,000 个样本来计算 FID, IS, KID 以及 OCR-SIM1。稳重使用无分类器指导(CFG)来测试超调节。

下表 1 展示了不同文本编码器的结果。可见,大型文本编码器产生了最好的定性结果,并且可以通过增加 CFG 的规模来改进条件生成。虽然定性样本没有足够的质量来解决问题,但 FigGen 已经掌握了文本和图像之间的关系。

论文插图也能自动生成了,用到了扩散模型,还被ICLR接收

下图 2 展示了调整无分类器指导(CFG)参数时生成的额外 FigGen 样本。研究者观察到增加 CFG 的规模(这在定量上也得到了体现)可以带来图像质量的改善。

论文插图也能自动生成了,用到了扩散模型,还被ICLR接收图片

下图 3 展示了 FigGen 的更多生成示例。要注意样本之间长度的变化,以及文本描述的技术水平,这会密切影响到模型正确生成可理解图像的难度。

论文插图也能自动生成了,用到了扩散模型,还被ICLR接收图片

不过研究者也承认,尽管现在这些生成的图表不能为论文作者提供实际帮助,但仍不失为一个有前景的探索方向。

更多研究细节请参阅原论文。

以上就是论文插图也能自动生成了,用到了扩散模型,还被ICLR接收的详细内容,更多请关注其它相关文章!


# 论文  # fig  # 也能  # 自动生成  # 腾讯  # 下表  # 过程中  # 展示了  # 提出了  # ai  # 兰蔻营销与推广方案设计  # 湖南大数据网络推广营销  # 石首怎么优化网站  # 武穴抖音推广网站  # 美团图片优化网站  # 女装店营销推广方式  # 高邑电商网站建设方案  # 上海门户网站建设  # 品牌餐饮营销推广方案  # 网站关键词排名优化工具  # 站上  # 更快  # 解决问题 


相关栏目: 【 行业资讯67740 】 【 技术百科0 】 【 网络运营39195


相关推荐: 在遥控器中power是什么意思  苹果16更新了哪些功能  如何用命令查看数据库日志文件  市盈率是负数是什么意思  linux如何跳回命令行界面  树莓派命令行如何新建文件  win10锁屏壁纸怎么换360锁屏壁纸吗  如何用命令提示符显示隐藏分区  车子上面nfc功能是什么意思  meet是什么意思  mac如何使用vi命令行  360手机壁纸怎么改  迅达热水器显示power是什么意思  个人征信不好如何恢复 个人征信不良的全面修复指南  市盈率高是什么意思  如何选择启用固态硬盘  开机如何运行dos命令提示符  命令不执行如何处理  如何查找固态硬盘  命令行如何启动应用程序  driver是什么意思  推特是什么软件国内可以使用吗  燃气热水器上的power是什么意思  苹果手机16新款颜色有哪些  夸克搜题的原理是什么  如何使用批处理命令编译vc程序  mac如何使用vi命令  typescript能开发什么  汽车排量是什么意思  vi命令如何退出编辑模式  如何注释typescript  企业征信不好如何恢复 企业征信不好怎么恢复步骤  命令行如何运行j*a  typescript接口怎么选  为什么都做折叠屏手机呢  arp命令如何使用  shell如何注释所有命令  闲鱼上面的power是什么意思  夸克缺什么登录不了  舆论是什么意思  平板键盘nfc功能是什么意思  put linux命令如何书写  阿里云盘共享账户怎么用  hive中datediff函数怎么用 Hive中DATEDIFF函数的使用指南  type-c输入接口是什么  哪些编程软件需用typescript  春运抢票可以抢几次票  j*a怎么用数组缓存  爱玛电动车power模式是什么意思  电脑type-c接口是什么意思 

搜索