Google发布PaLI-3视觉语言模型,性能相当于体积大10倍的模型
GoogleResearch和GoogleDeepMind日前发布了名为PaLI-3的新一代视觉语言模型,尽管仅拥有50亿参数,但其性能令人瞩目。与体积大10倍的竞争对手相比,PaLI-3在多模态测试中表现出色,能够回答关于图像的问题、描述视频、识别对象和读取图像上的文本。该研究团队表示,PaLI-3的性能表现,尽管仅有50亿参数,重新激发了对复杂VLM核心组成部分的研究兴趣,并有望推动新一代大规模VLM的发展。