Skip to content

什么是 WebAgent

WebAgent 是浏览器环境下的通用 Agent 平台——通过 API 让程序在真实浏览器里完成任务,小到一次原子搜索,大到运行一个月的长程目标。

四个 API

WebAgent 对外是 4 个并列的 API,按你要做什么直接选其一:

  • DoAnything —— 给一句自然语言 instruction,agent 自己挑工具、定路径,在浏览器里把任务做完。产物形态不定。
  • DeepResearch —— 给一个研究主题,做多轮检索 + 交叉核对,产出带引用和置信度的报告(final.md + citations + confidence)。
  • WebSearch —— 给一批查询,跨引擎取结果、去重、重排,返回结构化搜索结果(可选摘要)。
  • Track —— 给一个监控意图,按计划反复取数、和基线比对,变化时通知你(snapshot 序列 + 变更通知)。

公共能力:

  • Profiles —— 跨 session 复用登录态。不用每次重新登录
  • Workspaces —— 持久文件系统,agent 可读可写
  • Schedules —— cron / interval / event / autonomous(让 agent 自己决定何时再跑)
  • SSE 事件流 —— Console 用的同一套 run.* 事件,直接推到你代码里

它不是什么

  • 不是 low-code 自动化平台。没有可视化画布。任务是用代码(或 Console 当作原型工具)写出来的
  • 不是托管 LLM API。你把任务给 WebAgent,它替你挑模型并按 credits 计费

三种产品形态:Console / OpenAPI / SDK

这些 API 都通过同一组三种形态对外提供,三者能力 1:1 等价、共享同一份资源面 / 事件流 / 计费:

你用 ……来做 ……
REST API(OpenAPI)任何事。Console 与 SDK 都只是它的客户端。api.eak.eazo.ai/v1/... + Authorization: Bearer wa_...
Python / TypeScript SDK同样的 API,更地道的类型 + 重试 + 流式 + wait_for_done
Console可视化原型;非开发者也能用;Get Code 对话框直接给可运行片段

API 开发者优先——产品本质是一组 API;Console 是便利层,不是独立产品形态;不给 Console 特权端点。

资源模型

4 个 API 共享同一套事件流和计费,但各自的资源模型不同。DoAnything 用 session + run

Session                            (一个容器;持有浏览器、profile、workspace)
└── Run #1  status: completed      (一条 instruction;生命周期 7 态)
└── Run #2  status: running        (在同 session 里追加一条 instruction)
    └── events: SSE 流             (status_changed, message, action.*, screenshot, …)

Session 持有运行时资源(浏览器、profile、workspace)。每个 run 是一条 instruction;同一 session 里追加 run 会共享前一条 run 留下的状态。Run 有 7 个状态:pending / running / awaiting_input / paused / done / failed / canceled,详见 DoAnything

DeepResearch / WebSearch / Track 的资源模型不同:DeepResearch / WebSearch 是 standalone run(一次性产出、不暴露 session);Track 用长寿命的 monitor。各自的功能页有详述。

接下来读哪