Tsinghua KEG Lab и Zhipu AI совместно запустили CogAgent, большую модель понимания изображений

2023-12-28 08:27:29

Bit News: Tsinghua KEG Lab недавно сотрудничала с Zhipu AI, чтобы совместно запустить новое поколение CogAgent для понимания изображений больших моделей. Основанная на ранее запущенном CogVLM, модель использует визуальные модальности вместо текста, чтобы обеспечить более полное и непосредственное восприятие интерфейса GUI через визуальный агент GUI для планирования и принятия решений. Сообщается, что CogAgent может принимать ввод изображений высокого разрешения 1120×1120, с визуальным ответом на вопросы, визуальным позиционированием (Grounding), GUI Agent и другими возможностями, в 9 классических списках понимания изображений (включая VQAv2, STVQA, DocVQA, TextVQA, MM-VET, POPE и т.д.) достиг первого результата в общей способности.

VET2.24%

Посмотреть Оригинал

На этой странице может содержаться сторонний контент, который предоставляется исключительно в информационных целях (не в качестве заявлений/гарантий) и не должен рассматриваться как поддержка взглядов компании Gate или как финансовый или профессиональный совет. Подробности смотрите в разделе «Отказ от ответственности» .

Награда
лайк
комментарий
Репост
Поделиться

комментарий

0/400

Нет комментариев

WendyCS

Популярные темыПодробнее
#Gateperpdexislive
12.4K Популярность
#Joingrowthpointsdrawtowiniphone17
70.3K Популярность
#Cryptomarketrebound
202.2K Популярность
#ShowMyAlphaPoints
165.3K Популярность
#Fedofficialsspeakup
16.1K Популярность

Закрепить

Карта сайта