UI-TARS:基于原生智能体的GUI自动化革命指南

发布时间:2026/7/28 4:37:14

UI-TARS:基于原生智能体的GUI自动化革命指南
UI-TARS基于原生智能体的GUI自动化革命指南【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARSUI-TARS是一个革命性的开源多模态智能体框架专为自动化图形用户界面(GUI)交互而设计。这个项目代表了人工智能在桌面自动化领域的最新突破通过视觉语言模型(VLM)技术使计算机能够像人类一样看懂屏幕并执行复杂的交互任务。无论是桌面应用程序操作、网页自动化还是移动设备控制UI-TARS都能提供精准、高效的自动化解决方案。 核心技术架构深度剖析UI-TARS的核心在于其创新的三层架构设计将视觉感知、动作规划和系统级推理有机结合。视觉感知模块让AI看懂屏幕UI-TARS的感知模块采用了先进的视觉语言模型能够精确识别和理解屏幕上的各种GUI元素。系统支持多种感知任务元素描述(Element Description)准确识别按钮、输入框、菜单等界面组件密集字幕生成(Dense Captioning)为屏幕内容提供详细的文本描述状态转换分析(Transition Captioning)理解操作前后的界面变化问答交互(Question Answering)基于屏幕内容回答用户问题标记集合(Set-of-Mark)为特定元素添加视觉标记在codes/ui_tars/prompt.py中项目提供了三种不同的提示模板分别针对桌面环境(COMPUTER_USE)、移动设备(MOBILE_USE)和基础定位任务(GROUNDING)确保在不同场景下的最佳表现。统一动作空间设计UI-TARS定义了一套完整的动作空间覆盖了GUI交互的所有基本操作# 核心动作类型示例 click(pointpointx1 y1/point) left_double(pointpointx1 y1/point) right_single(pointpointx1 y1/point) drag(start_pointpointx1 y1/point, end_pointpointx2 y2/point) hotkey(keyctrl c) type(contentHello World) scroll(pointpointx1 y1/point, directiondown) wait() finished(content任务完成)系统级推理增强UI-TARS-1.5版本引入了强化学习驱动的推理能力显著提升了复杂任务的执行效果。系统通过思维链(Chain-of-Thought)机制在执行动作前进行逻辑推理大幅提高了决策的准确性和适应性。 快速入门从安装到第一个自动化任务环境准备与安装UI-TARS支持多种安装方式推荐使用uv工具以获得最佳体验# 克隆项目仓库 git clone https://gitcode.com/GitHub_Trending/ui/UI-TARS cd UI-TARS # 安装核心库 pip install ui-tars # 或使用uv uv pip install ui-tars基础自动化脚本编写以下是一个完整的自动化示例展示如何使用UI-TARS执行桌面操作from ui_tars.action_parser import parse_action_to_structure_output, parsing_response_to_pyautogui_code # 定义模型响应 response Thought: 点击开始菜单\nAction: click(start_box(150,300)) # 解析动作到结构化输出 original_image_width, original_image_height 1920, 1080 parsed_dict parse_action_to_structure_output( response, factor1000, origin_resized_heightoriginal_image_height, origin_resized_widthoriginal_image_width, model_typeqwen25vl ) print(解析后的动作结构:, parsed_dict) # 转换为PyAutoGUI可执行代码 parsed_pyautogui_code parsing_response_to_pyautogui_code( responsesparsed_dict, image_heightoriginal_image_height, image_widthoriginal_image_width ) print(PyAutoGUI代码:, parsed_pyautogui_code)坐标处理与可视化UI-TARS采用先进的坐标映射算法确保在不同分辨率和缩放设置下的精准点击。坐标处理的核心逻辑在codes/ui_tars/action_parser.py中实现def convert_point_to_coordinates(text, is_answerFalse): # 匹配 bbox 后面的四个数字 pattern rpoint(\d)\s(\d)/point def replace_match(match): x1, y1 map(int, match.groups()) x (x1 x1) // 2 # 使用截断取整 y (y1 y1) // 2 # 使用截断取整 if is_answer: return f({x},{y}) # 只返回 (x, y) 格式 return f({x},{y}) # 返回带标签的格式 # 去掉 [EOS] 并替换 bbox 坐标 text re.sub(r\[EOS\], , text) return re.sub(pattern, replace_match, text).strip() 性能优势与基准测试结果UI-TARS在多个标准基准测试中展现了卓越的性能表现计算机使用基准(OSWorld)UI-TARS-1.5: 42.5分100步OpenAI CUA: 36.4分Claude 3.7: 28分先前SOTA: 38.1分200步浏览器自动化基准WebVoyager: UI-TARS-1.5达到84.8分接近OpenAI CUA的87分Online-Mind2web: UI-TARS-1.5以75.8分领先超过OpenAI CUA的71分移动设备基准(Android World)UI-TARS-1.5: 64.2分显著超越先前SOTA的59.5分游戏性能表现在Poki游戏基准测试中UI-TARS-1.5在15款游戏中实现了100%的完成率包括2048、Cubinko、Energy等复杂游戏全面超越OpenAI CUA和Claude 3.7。 高级应用场景与实战指南办公自动化工作流UI-TARS可以自动化复杂的办公任务序列。例如自动化文档处理流程# 自动化Word文档处理示例 workflow [ 打开Word应用程序, 点击文件菜单, 选择打开选项, 导航到文档文件夹, 双击目标文档, 在文档中输入Hello World, 点击保存按钮, 关闭应用程序 ] # 每个步骤都可以通过UI-TARS自动执行 for step in workflow: # 生成对应的动作指令 action generate_action_from_instruction(step) execute_ui_tars_action(action)跨平台自动化测试UI-TARS支持跨平台自动化测试可以在Windows、macOS、Linux以及Android设备上执行相同的测试用例# 跨平台测试框架示例 class CrossPlatformTest: def __init__(self, platformdesktop): self.platform platform self.prompt_template ( COMPUTER_USE_DOUBAO if platform desktop else MOBILE_USE_DOUBAO ) def run_test_case(self, test_steps): for step in test_steps: response ui_tars_model.predict( promptself.prompt_template.format(instructionstep), screenshotget_current_screenshot() ) execute_action(response)智能数据提取与分析结合UI-TARS的视觉识别能力可以构建智能数据提取系统def extract_data_from_gui(element_type, element_description): 从GUI界面提取结构化数据 # 识别目标元素 element_location identify_element( element_type, element_description ) # 执行数据提取动作 if element_type table: return extract_table_data(element_location) elif element_type chart: return extract_chart_data(element_location) elif element_type text_field: return extract_text_data(element_location) 性能调优与最佳实践坐标精度优化策略坐标精度是GUI自动化的关键。UI-TARS提供了多种优化策略分辨率自适应自动检测屏幕分辨率并调整坐标映射智能缩放根据目标元素大小动态调整点击区域容错机制在坐标识别失败时提供备选方案def optimize_coordinate_accuracy( original_resolution, target_resolution, element_size ): 优化坐标精度 scale_factor calculate_scale_factor( original_resolution, target_resolution ) # 应用缩放因子 adjusted_coords apply_scale_factor( original_coords, scale_factor ) # 考虑元素大小调整点击位置 if element_size threshold: return adjust_for_element_size(adjusted_coords, element_size) return adjusted_coords模型性能优化针对不同规模的任务可以选择合适的模型配置UI-TARS-72B-DPO适合企业级复杂任务UI-TARS-1.5-7B平衡性能与资源消耗UI-TARS-1.5最高性能配置错误处理与恢复机制健壮的自动化系统需要完善的错误处理class UIAutomationAgent: def __init__(self, max_retries3): self.max_retries max_retries self.error_handler ErrorHandler() def execute_with_retry(self, action_func, *args, **kwargs): for attempt in range(self.max_retries): try: return action_func(*args, **kwargs) except AutomationError as e: if attempt self.max_retries - 1: raise self.error_handler.handle(e) self.recover_from_error() 生态系统集成与扩展与现有工具链集成UI-TARS可以无缝集成到现有的开发和工作流程中CI/CD管道集成自动化UI测试监控系统集成实时异常检测数据分析平台自动化数据收集自定义动作扩展开发者可以通过扩展动作空间来支持特定应用场景# 自定义动作示例 class CustomActionParser: def __init__(self): self.base_parser BaseActionParser() self.custom_actions { custom_click: self.parse_custom_click, gesture: self.parse_gesture_action } def parse_custom_click(self, action_str): # 解析自定义点击动作 pattern rcustom_click\(pointpoint(\d)\s(\d)/point, pressure(\d)\) match re.match(pattern, action_str) if match: x, y, pressure map(int, match.groups()) return { action_type: custom_click, coordinates: (x, y), pressure: pressure } 未来发展与路线图UI-TARS团队正在积极开发下一代功能即将推出的功能多模态交互增强支持语音和手势输入实时协作能力多人协同自动化云端部署优化支持大规模分布式执行研究发展方向零样本学习无需训练即可适应新应用跨应用工作流无缝衔接不同应用程序智能决策优化基于历史数据的自适应优化 社区支持与贡献指南获取帮助与支持官方文档详细的使用指南和API参考GitHub Issues报告问题和功能请求社区论坛与其他开发者交流经验贡献代码UI-TARS是开源项目欢迎社区贡献Fork项目仓库创建功能分支提交Pull Request通过代码审查最佳实践分享社区成员可以分享成功案例研究性能优化技巧集成解决方案结语开启GUI自动化新时代UI-TARS代表了GUI自动化技术的重大进步将人工智能的视觉理解能力与精确的动作执行相结合。通过本文的全面指南您已经了解了如何利用UI-TARS构建强大的自动化解决方案。无论您是希望自动化日常办公任务、构建自动化测试框架还是开发智能助手应用UI-TARS都提供了强大的技术基础。其开源特性、卓越的性能表现和活跃的社区支持使其成为GUI自动化领域的首选解决方案。立即开始您的UI-TARS之旅探索GUI自动化的无限可能【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

2026最新!商标注册全流程避坑指南,这5个雷区千万别踩

2026最新!商标注册全流程避坑指南,这5个雷区千万别踩

2026/7/28 4:27:14

2026最新!商标注册全流程避坑指南,这5个雷区千万别踩2026年6月,《商标法》迎来四十余年来首次全面修订,条文由73条增至87条,将于2027年1月1日起施行-1。新法在收紧注册规则的同时,也赋予了商标管理部门更多…

商标取名总是被驳回?审查员最爱3个命名套路一次讲透

商标取名总是被驳回?审查员最爱3个命名套路一次讲透

2026/7/28 4:27:14

商标取名总是被驳回?审查员最爱的3个命名套路一次讲透在深圳,商标驳回率常年居高不下。2026年新《商标法》对商标注册的审查标准进一步收紧——从囤标拦截到显著性审查,全面从严-1-5。很多创业者抱怨:“我取的名字明明很特别&…

创业公司必看:为什么说“市场未动,商标先行

创业公司必看:为什么说“市场未动,商标先行

2026/7/28 4:27:14

创业公司必看:为什么说“市场未动,商标先行”是条铁律?“公司名想好了,产品也快上线了,注册商标?不急,等做大了再说。”这是不少深圳创业者的真实想法。但这个看似“省事”的选择,可…

Klipper固件从入门到精通:STM32/Arduino配置、校准与实战调优指南

Klipper固件从入门到精通:STM32/Arduino配置、校准与实战调优指南

2026/7/28 5:37:16

1. 项目概述:为什么我们需要一个Klipper系列合集?如果你玩3D打印有一段时间了,大概率听说过Klipper这个名字。它不再是那个只在小圈子里流传的“黑科技”,而是逐渐成为了追求更高打印质量和更快打印速度的玩家们,甚至是…

L298N与掌控板驱动智能小车:从PWM调速到Wi-Fi遥控的完整实践

L298N与掌控板驱动智能小车:从PWM调速到Wi-Fi遥控的完整实践

2026/7/28 5:37:16

1. 项目概述:从“仰望3”的升级需求谈起手头这个“仰望3”小车,是我去年带着几个学生做的科创项目,底盘、结构都挺扎实,但动力部分一直是个心病。原配的电机驱动板太基础了,只能实现简单的正反转,想玩点速度…

openClaw记忆系统设计:多Agent协作与智能体开发关键技术

openClaw记忆系统设计:多Agent协作与智能体开发关键技术

2026/7/28 5:37:16

1. 项目概述:openClaw记忆系统设计背景在智能体(Agent)开发领域,记忆系统一直是决定Agent行为连续性和智能表现的核心模块。openClaw作为一款开源的多Agent协作框架,其记忆系统设计直接影响到Agent的上下文理解、任务延续和协作效率。不同于传…

TPIC7710EVM评估板实战指南:从硬件解析到GUI软件操作

TPIC7710EVM评估板实战指南:从硬件解析到GUI软件操作

2026/7/28 5:37:16

1. 项目概述与核心价值在汽车电子,特别是车身控制模块和底盘电控系统的开发中,工程师们常常面临一个挑战:如何将一颗功能强大的专用集成电路从冰冷的规格书,快速、可靠地转化为一个可以实际测试、验证的系统原型?尤其是…

Oculus与Skyline集成实战:2分钟数据同步的完整配置教程

Oculus与Skyline集成实战:2分钟数据同步的完整配置教程

2026/7/28 5:37:16

Oculus与Skyline集成实战:2分钟数据同步的完整配置教程 【免费下载链接】oculus The metric correlation component of Etsys Kale system 项目地址: https://gitcode.com/gh_mirrors/oc/oculus Oculus作为Etsys Kale系统的指标关联组件,是一款功…

Processing贪吃蛇实战:从游戏架构到创意扩展的完整指南

Processing贪吃蛇实战:从游戏架构到创意扩展的完整指南

2026/7/28 5:27:16

1. 从零到一:为什么用Processing重写贪吃蛇?如果你对编程感兴趣,或者想找一个项目来练手,那么“贪吃蛇”绝对是一个经典得不能再经典的入门选择。它规则简单,逻辑清晰,但麻雀虽小五脏俱全,涵盖了…

[具身智能-649]:个人电脑搭建 RTSP 服务完整方案(Windows / Ubuntu 双平台,适配 RDK X5 rtsp2display 调试)

[具身智能-649]:个人电脑搭建 RTSP 服务完整方案(Windows / Ubuntu 双平台,适配 RDK X5 rtsp2display 调试)

2026/7/27 8:45:59

目标:电脑作为RTSP 服务端,循环推送 H264/H265 视频流; RDK X5 通过 rtsp2display 拉流预览,完全不需要在开发板编译 live555。 提供两套成熟方案: ✅ 方案 A:FFmpeg(最简单,优先推…

PDF合并与动态水印的工程化方案:2026国内免费工具实测对比

PDF合并与动态水印的工程化方案:2026国内免费工具实测对比

2026/7/27 8:42:17

一、背景与测试方案 在实际项目交付中,PDF文件合并与版权保护水印的叠加是一个高频但容易被低估的技术需求。典型的处理链路涉及:多源PDF的文件流合并、页面级水印渲染(含透明度混合与图层叠加)、输出文件体积控制。看似简单的操作…

PDF拆分压完图糊了?2026国内免费实测,档案员都在用的组合方案

PDF拆分压完图糊了?2026国内免费实测,档案员都在用的组合方案

2026/7/27 14:56:57

说实话,提到PDF拆分再压缩,我真是被折腾得够呛。 上个月公司年度合同归档,一份300多页的PDF总合同,需要按年份拆分成三个独立文件,再分别压缩到10MB以内方便邮件发送各部门确认。我心想这还不简单?先找个海…

零基础搭建桌面智能体,OpenClaw 2.7.9 分步实操,避开绝大多数部署陷阱

零基础搭建桌面智能体,OpenClaw 2.7.9 分步实操,避开绝大多数部署陷阱

2026/7/28 0:06:55

📌 一、工具核心优势盘点 数据本地存储,安全系数高所有操作日志、文档资料均保存在本机,不会上传至云端,能够有效保护企业文件与个人隐私,规避数据泄露风险。 上手简单,零编程门槛采用全图形化可视化界面&…

计算机毕业设计之基于springboot的购物平台设计与实现

计算机毕业设计之基于springboot的购物平台设计与实现

2026/7/28 0:06:55

由于移动应用技术的持续性的快速发展,现实生活中人们大多数都是通过移动手机、电脑等智能设备来完成生活中的事务。因此,许多的人工传统行业也开始与互联网结合,不再一味的依靠人工手动,努力打造半自动数字化甚至是全自动数字化模…

豆包AI绘图提示词失效真相:NLP模型层token截断机制首次披露,3招绕过字数限制

豆包AI绘图提示词失效真相:NLP模型层token截断机制首次披露,3招绕过字数限制

2026/7/28 0:06:55

更多请点击: https://codechina.net 第一章:豆包AI绘图提示词失效现象全景扫描 近期大量用户反馈,豆包(Doubao)AI绘图功能对常规提示词(Prompt)响应异常:语义明确的指令被忽略、中英…