昊梵体育网

【为何AI视频的文字总是歪歪扭扭?】为什么AI生成的照片或视频上,文字的每一笔总

【为何AI视频的文字总是歪歪扭扭?】为什么AI生成的照片或视频上,文字的每一笔总是歪歪扭扭的?其实本质就是技术所限……在过去的三年,生图和视频的底层架构是扩散模型,它的基本原理是降噪和预测像素。

如扩散模型论文中的原图所示,在一开始图像是一些随机分布的噪点,模型会根据它训练图形中的规律,一点点去噪,从而“还原”出完整的图像。

对于扩散模型而言,它只能理解一张图片中像素的分布,不理解这些像素合起来有什么有意义。文字对它而言,只不过一些“黑白相间的像素点阵”,虽然跟背景、人物在像素的分布上有些不同,但模型仍然将它们“一视同仁”。

文字本身是非常复杂且锐利的图样,而降噪本身有带有随机性,即使做大量针对性的训练,仍然改变不了“扩散模型不会写字”的底层逻辑。

这种情况到了视频领域会更加严重,因为多了时间维度。因为扩散模型不理解画面的内容,它只能看到变化的像素,无法区分静态的文字和运动的物体,产生的文字质量会变得更加低下。(中科院物理所)中国科普博览