苹果探索自研多模态 AI 模型 Manzano,图像理解与生成能力兼备

IT 时代网讯:9 月 27 日消息,苹果正在研发一款名为 Manzano 的多模态 AI 模型。
该模型采用混合图像分词器,其共享编码器可输出连续标记和离散标记,以减少任务冲突。整体架构包括混合分词器、统一语言模型和独立图像解码器。训练使用了 23 亿对图像 - 文本样本和 10 亿对文本 - 图像样本。内部测试显示,Manzano 在 ScienceQA 等基准测试中表现优异,尤其在图表和文档分析等文字密集型任务中,300 亿参数版本成绩突出。
本文为 AI 大模型生成,如有错漏,请与我们联系,更多资讯,请关注 IT 时代网!
THE END