browser-use · Browser & OS Action
给浏览器一个目标,让 Jev 选择操作和页面控件,需要输入文字时再调用文本模型。
根据当前 DOM,在一次请求里选择操作和相应控件;文本模型负责生成输入内容。
把界面选择、文字生成与浏览器执行分开,方便查看每一步。
作者在单一 Google Flights 任务上做了每组 3 次对照,报告中位数约 7.1 秒;初始导航未计入,不是通用 Agent 基准。