字节Seed开源UI-TARS-1.5:基于视觉语言模型构建的多模态智能体

字节Seed开源UI-TARS-1.5:基于视觉语言模型构建的多模态智能体

IT之家 4 月 18 日消息,IT之家从豆包大模型团队获悉,UI-TARS-1.5 昨日正式发布并开源。这是一款基于视觉-语言模型构建的开源多模态智能体,能够在虚拟世界中高效执行各类任务。

有关的链接如下:

GitHub:https://github.com/bytedance/UI-TARSWebsite:https://seed-tars.com/Arxiv:https://arxiv.org/abs/2501.12326

UI-TARS-1.5 基于字节此前提出的原生智能体方案 UI-TARS,通过强化学习进一步增强了模型的高阶推理能力,使模型能够在“行动”前先进行“思考”。

该版本的模型中,团队还展示了一个新的愿景:以游戏为载体来增强基础模型的推理能力。与数学、编程等领域相比,游戏更多依赖直观的、常识性的推理,并较少依赖专业知识,因此,游戏通常是评估和提升未来模型通用能力的理想测试场景。

据介绍,UI-TARS 是一个原生 GUI 智能体,具备真实操作电脑和手机系统的能力,同时,还可操控浏览器、完成复杂交互任务。UI-TARS-1.5 能够实现精准 GUI 操作,基于团队在四个维度的技术探索:

视觉感知增强:依托大规模界面截图数据,模型可理解元素的语义与上下文,形成精准描述。System 2 推理机制:在动作前生成“思维(thought)”,支持复杂任务的多步规划与决策。统一动作建模:构建跨平台标准动作空间,通过真实轨迹学习提升动作可控性与执行精度。可自我演化的训练范式:通过自动化的交互轨迹采集与反思式训练,模型持续从错误中改进,适应复杂环境变化。

来源:飞象网
免责声明:本文内容来源于第三方或整理自互联网,本站仅提供展示,不拥有所有权,不代表本站观点立场,也不构成任何其他建议,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容,不承担相关法律责任。如发现本站文章、图片等内容有涉及版权/违法违规或其他不适合的内容, 请及时联系我们进行处理。

相关推荐

  • 从道歉到开源,智谱这三天经历了什么?

    智谱旗下AI编程工具ZCode在近期引发诸多数据争议。今天,智谱正式宣布将ZCode开源,并公布了第三方安全审计结果,确认云端“零数据”状态、同时最新版本已切断本地仓库快照生成与上传链路。 三天内从道歉到开源,智谱立正挨打的态度值得肯定。但这期间发酵的几场风波,的确给智谱和其他同行都上了一课。 事情起因发生在9月18号...

    2026-09-21
  • 不靠生成画面预测未来,千里智驾开源 WA-JEPA 双榜跑出最佳成绩

    9月18日消息(报道:李楠)近日,千里智驾联合电子科技大学、东南大学、北京邮电大学、天津大学发布并开源世界—动作模型WA-JEPA,为自动驾驶模型如何理解场景、预测未来并生成驾驶动作,探索了一条新的技术路径。 当前,部分自动驾驶世界模型通过生成未来视频来学习环境变化。这类方法能够呈现直观的未来画面,但也需要投入大...

    2026-09-18
  • 腾讯混元 Hy4 preview发布,稳居开源模型第一梯队

    8 月 28 日,腾讯混元发布并开源新一代大语言模型 Hy4 preview ,总参数 770B、激活参数 49B,上下文长度突破 1M,在代码、办公、科学等真实生产力任务上展现出卓越能力。 Hy4 preview 在模型尺寸、上下文长度、数据规模上都进行了显著的扩展,预训练和后训练的共同进步带来了智能水平的又一次巨大...

    2026-08-28
  • 字节推统一办公品牌“豆包工作”,TRAE、扣子并入豆包

    8月24日消息,据媒体报道,字节跳动对旗下办公AI产品完成一轮团队整合:TRAE、扣子(Coze)团队将整体并入豆包体系,豆包最快将于本周内推出独立AI办公产品“豆包工作”,作为字节面向AI办公场景的统一品牌。 调整后,TRAE Work、扣子将与豆包在工作场景的产品能力进行整合;TRAE IDE及CLI将作为豆...

    2026-08-25
  • 火山引擎上线Seedance 2.5 API:原生支持30秒视频直出,向产业生产力工具演进

    8月7日消息,字节跳动火山引擎今日正式上线Seedance 2.5 API服务。该模型原生支持30秒视频直出,支持单次输入最多50个多模态素材(30张图片、10段视频、10段音频)作为参考,并具备精准的时间戳编辑能力,已在LibTV、奇想AI、TapNow等平台同步上线。 相较于2.0版本,Seedance 2....

    2026-08-07
  • MiniMax H3开源:AI视频生成进入“拼生态”新阶段

    7月31日,MiniMax发布新一代全模态生成模型H3;8月3日,模型权重正式开源。 MiniMax H3采用通用多模态架构,支持文本、图像、视频和音频的统一理解与生成,可输出最高2K分辨率、最长15秒、带原生立体声音频的视频内容。 而这可能标志着开源正从语言模型领域蔓延至多模态生成领域,AI视频生成赛道的竞争规则,也...

    2026-08-04
  • 字节跳动Seedance 2.5正式发布:单次生成30秒视频

    7月31日消息,字节跳动今日正式发布新一代视频生成模型Seedance 2.5。该模型延续了Seedance 2.0统一的多模态音视频联合生成架构,在生成时长、多模态理解、编辑精度等核心维度实现全面升级,目前已陆续上线即梦AI、豆包专业版等平台,API服务也将于近期接入火山引擎。 据官方介绍,Seedance 2...

    2026-07-31
  • 黄仁勋力挺中国开源AI:市场两次误判,封禁反而让美国更脆弱

    7月23日消息,美国英伟达公司创始人兼CEO黄仁勋近日在接受Axios专访时,就中国开源AI模型的发展及Kimi K3引发的市场震荡,发表了一系列与美国政府及部分硅谷同行截然相反的观点。 “这些中国模型非常优秀。”黄仁勋表示,“优秀的开源模型应该被使用。” 针对月之暗面发布的Kimi K3引发的市场恐慌,黄仁勋直...

    2026-07-25
  • 技术自主,始于开源架构

    在快速演进的科技格局中,越来越多的专有技术供应商正主导企业使用数据和AI的方式,包括工具、标准及参与规则。少数厂商掌控全球技术的基础架构,也意味着将由这些厂商决定参与者、参与成本以及参与方式。

    2026-07-22
  • WAIC时刻丨面壁智能正式发布并开源MiniCPM-Robot具身系列模型

    (报道:孟祥龙)在2026WAIC世界人工智能大会期间,端侧AI独角兽面壁智能联合OpenBMB正式发布并开源了其首个具身智能技术成果 MiniCPM-Robot 系列模型,端侧AI「小钢炮」正式进军机器人领域。 据悉,本次发布的MiniCPM-Robot系列成果包括:通用VLA模型MiniCPM-RobotM...

    2026-07-21