一个工作日的早上,我还没到工位,就先在手机上给 WorkBuddy 发了一条指令:“把昨晚下载的资料按日期归类,顺便把项目周报初稿写到桌面文档里。”等我打开办公室电脑时,桌面上已经整整齐齐排好了文件夹,周报初稿也躺在那里。达成这一切的,不是什么玄学,而是 WorkBuddy 的 Claw 功能——一个让 AI 真正“长出手”、可以远程操控电脑的智能体能力。这篇我想认真聊聊它:Claw 到底解决了什么问题、怎么把手机和电脑连起来、它能帮我们干哪些实际工作,以及跑了一段时间之后你大概率会遇到的一些坑。
1. Claw 到底是个什么东西:不是远程控制,是 AI 自己长了手
1.1 同样叫“远程”,向日葵和 Claw 的区别在哪
很多人第一次听到 WorkBuddy 的 Claw,第一反应是:这不就是手机远程控制电脑吗?向日葵、TeamViewer 不早就能做到吗?我一开始也是这么想的,直到真正用起来才发现,两者的底层逻辑完全不同。
向日葵这类远程控制软件,本质是“把人的手和眼接长”。它的核心链路是:电脑屏幕画面编码传到你手机上,你的眼睛看到画面,你的手指在手机上点按,再把键鼠指令传回电脑。整个过程里,做决策的是人,传输的是“画面”和“键鼠事件”,所以这类软件最在乎的是延迟、帧率和带宽。远程控制下的电脑,只不过是一台被遥控的机器。
而 WorkBuddy 的 Claw,核心链路变成了:你在手机上发一句自然语言指令,AI 在电脑端“看”屏幕内容,理解界面结构,然后自己决策、移动鼠标、点击、输入文字、运行命令,完成后把结果摘要回传给你。整个过程中,手机和电脑之间传输的不是画面,而是“任务指令 + 执行日志 + 结果摘要”。你不需要盯着屏幕看它一步步操作,只要最后验收结果就行。
我常用的类比是:向日葵像是你坐在副驾,方向盘和刹车都通过一根很长的杆子连到你手里,所有路况判断都要自己做;Claw 更像是你坐在后排报了个目的地,说了一句“走高速、别超速”,司机自己看路、自己打方向盘,中途遇到堵车还会绕路,到了地方告诉你一声。所以 Claw 解决的不是“远程操作电脑”,而是“远程把活交给 AI 干”。这个差别,决定了它的应用场景比远程控制大得多。
1.2 Claw 能干什么、不能干什么:权限边界必须心里有数
Claw 不是万能的,它有一张清晰的权限边界表。我在帮朋友配置的时候,发现很多人对它的能力边界有误解,要么以为它什么都能干,要么以为它什么都干不了。下面这张表是我实际使用下来比较准确的分界线:
| 任务类型 | Claw 能否处理 | 说明 |
|---|---|---|
| 打开浏览器、访问网页、点击链接、填写表单 | 能 | 通过浏览器自动化读取和操作页面,是 Claw 最稳定的能力 |
| 读取、移动、重命名、归档本地文件 | 能 | 通过本地文件系统权限执行,给绝对路径成功率很高 |
| 运行脚本、执行终端命令 | 视授权而定 | 需要在配置里开启终端权限,且命令规则可审计 |
| 登录页面自动输入账号密码 | 通常不行 | 敏感凭据默认不允许进入 AI 上下文,这是安全设计 |
| 图形验证码识别 | 可能卡住 | 部分简单验证码能过,复杂的基本需要人工介入 |
| 操作手机端 App | 不能 | Claw 面向的是电脑端桌面环境 |
| 音视频实时通话、会议发言 | 不能 | Agent 的目标是桌面 GUI,不是多媒体内容处理 |
| 绕过任何登录态、验证码、风控策略 | 不能 | 这类诉求本来就不应该通过自动化实现 |
为什么 Claw 要刻意设这么多限制?核心原因是“可观察、可回滚、可审计”。每一步操作都会记录日志,出了问题能够追溯;涉及敏感凭据或危险命令时,系统宁可停下来问人,也不让 AI 自主操作。这种边界不是缺陷,反而是它能被放心用来干活的前提。
还有一个容易忽略的点:Claw 操作的是“屏幕和界面”,所以它对界面状态非常敏感。指令下达时如果界面和你描述的不一致,AI 可能会强行猜测,然后点错按钮。所以用 Claw 时,对话框里把前提条件写清楚,比写“你看着办”要高效十倍。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 从零到跑通:手机和电脑搭上线的完整流程
2.1 电脑端要准备什么
先说电脑端。WorkBuddy 的桌面客户端是 Claw 的载体,它负责让 AI 能够“观看并操作”你的电脑。第一次配置时,有几个点容易漏,我按顺序列一下:
- 系统要求:Windows 10/11 64 位或 macOS 12 以上,内存建议 8GB 起步,跑 ComfyUI 那类任务最好 16GB。
- 安装 WorkBuddy 桌面客户端,安装过程中有个“安装 Claw 运行时(后台服务)”的选项,一定要勾上。如果当时跳过了,后续可以在设置里补装,但很多人就是漏了这一步,导致手机 App 上死活看不到 Claw 入口。
- 安装完成后首次启动,客户端会请求辅助功能权限。macOS 需要去“系统设置-隐私与安全性”里给 WorkBuddy 授予“屏幕录制”和“辅助功能”权限;Windows 会弹出允许自动化操作的确认。这两个权限不授,Claw 连上了但看不到屏幕内容,现象就是一直转圈、没有实际操作。
- 如果你打算用 Claw 做浏览器自动化,最好预先装好 Chrome 或 Edge,保持默认安装路径。WorkBuddy 的 Agent 默认会调用其中一个,没装或者路径被改过会频繁出问题。
- 电源管理:把电脑的电源计划改成“从不睡眠”,笔记本还要设置“合上盖子不睡眠”。不然你在外面用手机发任务,电脑早就睡着了,任务直接失败。这是所有远程类工具都躲不开的设置,Claw 也不例外。
我第一次在 macOS 上配置时,客户端能正常连接,但 Claw 一执行就拿不到屏幕内容,折腾了半天,最后发现是“屏幕录制”权限没给。这个权限在授权弹窗里点了“允许”之后,有时候还需要重启客户端才会真正生效。遇到黑屏或一直卡在“检查屏幕”的情况,先检查这一步。
2.2 手机端搭配与授权验证
电脑端就绪后,手机端就简单多了:
- 在应用商店搜索 WorkBuddy 并安装,用同一个账号登录。记住,App 和电脑端必须同账号,不然设备列表是空的。
- 进入“设备”页面,正常情况下能看到同一账号下的电脑设备,状态显示“在线”。
- 点击“连接”,手机会进入配对流程,通常是扫描电脑端二维码或输入配对码,电脑端弹窗确认授权。
- 授权成功后,设备卡片下方会出现“Claw:可用”的状态。到这一步,就说明手机到电脑的通道已经打通。
通道打通后,建议先发一条最简单的测试指令,比如“打开记事本,输入 hello,然后保存到桌面”。确认 AI 真的能在电脑上动起来,再上正式任务。不要一上来就发一个五步以上的复合任务,出了问题不好定位。
2.3 死活看不到 Claw 的排查清单
“WorkBuddy 没有看到 claw,怎么让他显示”是很多人问的问题。我总结了一份排查清单,按顺序检查,大部分情况都能解决:
- 版本是不是太旧。手机端和电脑端都必须更新到支持 Claw 的版本,老版本界面里根本没有这个入口。
- 桌面客户端到底装了没有。如果只装了手机 App,WorkBuddy 只是个大模型聊天框,Claw 入口自然不会出现。必须先有电脑端。
- Claw 运行时有没有启动。Windows 上打开任务管理器,看 WorkBuddy 相关进程是否在运行;macOS 上看菜单栏图标是否正常。如果被安全软件禁用了自启动,需要手动拉起来。
- 是不是入口被折叠了。手机 App 的设备详情页有时候默认只显示“远程对话”等图标,Claw 能力入口在二级菜单里,需要点“更多能力”或“展开能力列表”才能看到。这一点官方文档写得不够明显,很多人卡在这。
- 账号是否一致。两个端登录的不是同一个账号,设备列表肯定是空的。
- 网络环境。手机和电脑在同一个局域网内最稳定;跨网络时依赖服务端中继,公司网络如果限制比较严格,可能连不上。
- 重启大法。更新客户端、补授权之后,把 App 和桌面客户端都彻底退出,再重新登录一遍,设备状态往往就刷新出来了。
这个排查过程,基本覆盖了我见过的所有“看不到 Claw”的情况。如果你按照这个顺序走完还不行,可以在设置里导出日志发给官方技术支持,比在群里盲猜效率高很多。
3. 手机下指令,AI 动鼠标:三个我高频在用的真实场景
3.1 浏览器里的活:查资料、采集、填表单
浏览器是 Claw 用得最顺的领域,因为它有清晰的界面元素,AI 通过无障碍树或截图识别,能比较准确地定位按钮和输入框。
我出门在外最常用的一个指令是让 Claw 去查竞品信息并整理成 Markdown 文档。比如我会说:“打开 Chrome,访问 XX 官网的‘价格’页面,找到套餐名称和价格,整理成 Markdown 表格,保存到桌面 price.md,把链接也发给我。”整个过程不用我亲手开电脑,AI 自己完成打开浏览器、输入网址、等待加载、定位价格区块、提取文本、写入文件。到公司时,桌面文件已经在了。
但这类任务有个核心技巧:一定要限制提取范围。如果不加限制,AI 会试图把整个页面的正文都塞进上下文,token 消耗暴涨,后面任务容易把上下文吃满。所以我现在都会在指令末尾加一句“只提取套餐名称和价格,其他内容不要”。
另一个常用的浏览器任务是批量截图。比如需要把某个长页面完整截下来,我会说:“打开某网站,等页面加载出 XX 元素后再开始操作,滚动到页面最底部,每滚一屏截一张图,保存到桌面截图文件夹。”为什么强调“等 XX 元素出现后再开始”?因为 Claw 是程序化操作,它不知道页面有没有加载完,如果你不指定一个判断条件,它很可能在页面还在转圈的时候就开始截图,截出来的全是空白。
还有一个特别值得说的点是表单填写。Claw 能填表单,但碰上需要登录的系统,它大概率会卡在登录页。解决方法是提前在电脑浏览器里保持登录态,或者明确告诉它“登录态已经存在,直接进入页面操作”。不要试图让 AI 帮你输入账号密码,它默认不会处理敏感凭据,而且把密码写进任务文本本身就是安全风险。
3.2 让 Claw 去跑 ComfyUI,出图不收摊
ComfyUI 玩家应该是最喜欢 Claw 的人群之一。以前跑图必须坐在电脑前,现在通过 WorkBuddy 的 Claw,人在外面也能远程发图、改参数、收图。
用 Claw 跑 ComfyUI 有两种路线。第一种是“界面路线”:让 Claw 打开 ComfyUI 的网页界面(默认是 http://127.0.0.1:8188),导入工作流文件,在节点里修改参数,然后点击 Queue Prompt。这种方式对 AI 的界面识别能力要求高,因为 ComfyUI 的节点多、连线复杂,节点名称默认都是英文技术名词,AI 很容易看错哪个节点该改参数。
第二种是“API 路线”,也是我现在更推荐的:让 Claw 直接调用 ComfyUI 的本地 API 接口,不靠点击界面,而是把工作流参数以 JSON 形式提交。举例来说,我会直接发指令:“用 ComfyUI API 加载 sdxl 工作流,提示词为 a cat playing guitar in the rain,种子随机,跑 1 张图,输出到 output 目录,完成后把图片文件名发给我。”这种方式绕开了界面点击的很多不确定性,只要工作流 JSON 是正确的,AI 执行成功率明显更高。
这里有一个我踩过的坑:ComfyUI 的节点如果不重命名,默认一堆节点都叫“KSampler”或“CLIP Text Encode”,Claw 在界面上根本分不清哪个是哪条分支的。后来我把常用的工作流节点都重命名成了中文语义明确的名称,比如“采样器-主图”“正向提示词-主图”,再让 Claw 操作界面路线时,成功率提升得非常明显。如果你主要用 ComfyUI,建议固定一套工作流,节点命名规范,不要每次新建。
3.3 本地文件整理:批量归档、重命名、跑脚本
文件整理是 Claw 非常靠谱的另一个领域,尤其适合处理那种“不想亲手做但又不难”的机械操作。
最常见的场景是整理下载目录。我会给 Claw 一条这样的指令:“把下载文件夹里所有 PDF 文件按年份归档,2024 年之前的放进‘旧文档’文件夹,2024 年及以后的放进‘2024文档’文件夹。只移动文件,不要删除,完成后告诉我每个文件夹有多少个文件。”Claw 会调用本地文件系统接口,遍历目录、识别文件时间属性、移动文件、统计数量。
这里有一个和 Windows 中文系统相关的坑:在中文系统里,文件资源管理器显示的“下载”文件夹,真实路径往往是 C:\Users\用户名\Downloads,但界面上显示的是“下载”。Claw 通过界面操作时,看到的可能是本地化名称;通过命令行操作时,可能要用真实的英文路径。如果 AI 找不到文件夹,最直接的解法是:在指令里直接给出绝对路径,不要用“下载文件夹”这种模糊表述。
还有一类是跑脚本。我有些 Python 脚本需要定期执行,比如数据清洗、日志汇总。我会在手机上告诉 Claw:“在 D:\tools\ 目录下运行 data_clean.py,把运行日志输出到 run.log,完成后读取日志最后 20 行发给我。”Claw 打开终端、切换目录、执行命令、读取结果,一气呵成。
但涉及删除操作时,我强烈建议在指令里明确加上“只移动不删除”或“删除前先列目录让我确认”。不是说不信任 AI,而是删除操作不可逆,一旦路径判断出错,损失的是真数据。Claw 的日志只能帮你追溯“发生了什么”,帮不了你找回删掉的文件。
4. 用多了就一定会碰到的四个问题
4.1 上下文用量满了,Claw 突然开始“失忆”
“WorkBuddy 上下文用量满了怎么办”是社区里讨论很多的话题。我来说说它的本质:Claw 在执行任务时,会把屏幕截图、网页文本、文件内容等信息写入上下文,这些信息非常占空间。一个长任务跑下来,上下文很容易就见底了。现象是什么?AI 突然忘记了你最初交代的背景,或者在任务中途开始追问已经在前面说过的信息,甚至把自己绕晕。
如果你的用量满了,正确的处理顺序是:
- 打开 WorkBuddy 的“用量管理”面板,看看哪个会话占用的 token 最多。很多时候是之前某个没关的测试会话在偷偷占资源,直接清掉它。
- 为当前任务新建一个会话,把关键背景精简成两三句话重新发一遍。不要怕重新描述,一个干净的上下文比什么技巧都重要。
- 如果任务还没跑完,优先恢复“当前步骤+下一步目标”,放弃前面的过程性细节。AI 不需要记得所有中间过程,只需要知道现在做到哪了、接下来要干什么。
- 从源头控制:任务指令里明确限制输出和阅读范围,比如“只提取表格前三行”“不要读取整个日志文件,只看最后 50 行”,这类限制能省出大量上下文空间。
我在实际使用时,最大的体会是:Claw 的上下文就像杯子里的水,屏幕内容占一半,网页文本占三分之一,指令和生成占剩下部分。少往杯子里倒多余的东西,比买更大的杯子更现实。所以我现在发指令都养成了“极简主义”习惯:目标、路径、限制条件,三句话说完,不铺垫背景。
4.2 任务卡在“正在操作”,该怎么排查
这是一个几乎所有人都会遇到的问题:手机端显示“AI 正在操作”,但电脑端半天没有实际动作,或者一直转圈。
碰到这种情况,先别慌,按顺序排查:
- 看执行日志。WorkBuddy 的 App 里能看到当前任务的执行日志。如果日志还在持续滚动,说明 AI 还在工作,可能只是某一步耗时较长;如果日志长时间没更新,才叫卡住。
- 检查电脑状态。锁屏、屏保、睡眠都是 Claw 的头号杀手。电脑一旦锁屏,Claw 可能无法获取屏幕内容,表现为“能看到连接但看不到画面”。很多人的电脑没有设置“从不睡眠”,任务跑到一半电脑休眠,一切归零。
- 检查是否有弹窗抢焦点。Windows 系统经常弹出更新提醒、杀毒软件提示、浏览器“是否保留 Cookie”之类的小对话框。这些弹窗会把焦点抢走,Claw 原本操作的目标界面被盖住,它可能就不知道点哪里了。
- 检查网络连接。手机端和电脑端的设备连接如果断了,手机上会一直显示“正在操作”,但电脑端其实已经空闲。这时点“中断任务”,重新连接后再继续。
我踩过的最深一个坑:电脑开了屏幕保护程序,Claw 在唤醒屏幕之后鼠标坐标发生了偏移,导致它把一组按钮点错,任务后面全部跑偏。从那以后,我把电脑的电源计划设置成了“永不睡眠”,屏保也干脆取消。对于 Claw 这类工具,让电脑始终保持清醒状态,是最基本的物理条件。
4.3 权限过期和登录失效:AI 也会被登录页卡住
Claw 操作浏览器时,最怕的不是网页打不开,而是登录态失效。今天浏览器里还登录着某个系统,明天 Cookie 到期,AI 一打开就跳到登录页,它默认又不会填账号密码,任务就卡死在登录这一步。
我的处理方案有两个。第一个方案是预先准备:定期在电脑浏览器里保持关键系统的登录态。Claw 在调用浏览器时,如果使用的用户数据目录和平时是同一个,登录态就能延续。但要注意,有些自动化方案会使用独立的浏览器 profile,不会读取你平时浏览器的 Cookie。所以最稳妥的做法是,在任务开始前自己确认一下目标系统是否处于登录状态。
第二个方案是人工介入:WorkBuddy 在遇到验证码或需要人工处理的场景时,手机端会收到一条“需要人工处理”的通知。你可以远程进行确认,或者解锁电脑后手动处理登录,然后再让 AI 继续。这个设计很聪明,它没有把 AI 设计成万能的,而是把 AI 不擅长、也不应该碰的环节留给人类,形成一个人机协作闭环。
安全上我还是想多说一句:不要把你的账号密码写进任务指令里,也不要让 Claw 帮你保存密码。Agent 的任务记录是会留存日志的,密码一旦进入日志,泄露面就变大了。能用人工介入解决的事情,不要图省事交给 AI。
4.4 哪些任务别硬塞给 Claw:能力边界之外的幻想
Claw 很好用,但它绝对不是“全自动打工替身”。有些任务你让 Claw 干,纯属给自己添堵:
- 实时音视频会议:Claw 不能替你在会上发言,也不能“看”视频内容。如果你幻想让 AI 替你在腾讯会议上讲 PPT,现在还不是时候。
- 需要物理操作的事:插拔 U 盘、按开机键、换电池这类要动手的事,Claw 完全无能为力。
- 高度依赖审美判断的工作:Claw 能跑出图流程,但“这张海报好不好看、这个排版对不对”,它不具备和设计师同等的审美决策能力。你可以让它生成多个方案,最后选还是自己来。
- 强验证和高风险操作:转账、付款、找回账号密码、解除风控,这些场景不该走 AI 自动化,也走不通。Claw 的安全边界在某种程度上是在保护你,而不是限制你。
把 Claw 定位成“执行力很强的实习生”最贴切:重复、耗时、不费脑的活,它干得又快又稳;但涉及决策、判断、审美、风控的事,你必须亲自把关。理解了这一点,你就不会在错误的任务上浪费太多时间。
5. 我把 Claw 用得更顺的几条经验
5.1 任务拆小,逐步下发,不要一口气说完
我前面提过很多次“拆小任务”,这真的是使用 Claw 最核心的经验。同样一份工作,你用“帮我整理季度报告”一个大指令,和拆成“先收集数据、再生成大纲、然后写正文、最后套模板”四步走,效果完全不同。大指令虽然省事,但 Claw 在中间步骤一旦出错,你很难定位问题在哪一步;而且一个大任务消耗的上下文往往是小任务的好几倍,跑到一半就“失忆”是常事。
拆任务还有一个隐藏好处:每一步你都能验证中间结果。比如让 Claw 先列出数据来源,确认没问题了再让它写正文。这种“逐步验收”的节奏,本质上是把 AI Agent 当成一个不成熟的实习生来管理。你盯得紧一点,它出错的概率就低一点。现在我下指令的基本格式是“目标 + 路径 + 限制条件 + 验收方式”,四要素缺一个都要补。
5.2 用 Skill 把常用流程固化成模板
WorkBuddy 的 Skill 功能很值得投入时间。它的本质是把一套固定的提示词和工具调用流程封装成一个可复用的技能包。比如我经常要做“周报生成”,就把这个流程固化成了一个 Skill:让 Claw 抓取过去一周的 git 提交记录、整理成要点、读取指定 Excel 模板、生成周报文档并保存到指定位置。
创建 Skill 之后,我在手机上只需要发一句“生成上周周报”,Claw 就会自动按 Skill 里定义的步骤执行,中间不需要我重新描述背景和路径。这解决了两个问题:一是省 token,每个小节都复用固化流程,不需要每次把上下文重新加载一遍;二是稳,同样的步骤执行一百次,比每次临时写指令要可靠得多。
如果你刚开始用,我的建议是先找一件每周都要做、流程固定的事,把它做成第一个 Skill。不用追求一步到位,先让流程跑通,再逐步优化。Skill 做得好的话,Claw 的实用性会上一个台阶。
5.3 API 接入:让 WorkBuddy 和其他工具联动
WorkBuddy 不只是个 App,它还提供 API 接入能力。这意味着你可以把它当成自动化流水线的一环,而不是一个孤立应用。
我现在的做法是:在自己的脚本里通过 HTTP 接口调用 WorkBuddy,提交任务指令,流程结束后由 WorkBuddy 回调我的服务通知结果。比如我有个定时脚本,每天凌晨检查某个外部系统的数据,如果发现异常,就自动给 WorkBuddy 发一条指令,让 Claw 在电脑上打开对应系统刷新页面、截图留证,然后把截图发到我的手机。
接入 API 时有几个安全细节:API token 不要写死在代码里,更不要提交到 git 仓库,用环境变量或密钥管理工具保存。调用接口时尽量只授权给必要的 IP 或服务,不要用全局限权 token。
这个能力让 WorkBuddy 从一个“手机遥控器”变成了“自动化编排平台”。你的定时任务、监控脚本、业务流程都能通过它获得“抓取屏幕、操作本地软件”的能力,想象空间很大。
5.4 WorkBuddy 和 CodeBuddy,到底怎么选
社区里经常有人问 WorkBuddy 和 CodeBuddy 的区别,我简单说下我的理解。这两个产品定位完全不同,不是替代关系。
CodeBuddy 更偏向程序员,核心场景是写代码:代码补全、代码审查、仓库问答、IDE 内助手,它解决的是“开发和编程”这一件事。WorkBuddy 更偏向通用办公和自动化,核心能力是 Claw 的远程操控和跨应用任务执行,解决的是“让 AI 帮你操作电脑干活”这件事。如果你一天到晚泡在 IDE 里,CodeBuddy 顺手;如果你是运营、产品、设计,或者需要用 ComfyUI、整理文件、跑浏览器任务,WorkBuddy 才是对症的那个。
当然也可以两个都用,它们并不冲突。我自己在写代码时会用 CodeBuddy 补代码,在需要远程让电脑干活时就用 WorkBuddy 的 Claw。选型这件事,核心是看你每天花时间最多的事情是什么,工具跟着任务走,别任务跟着工具走。
最后再说一点个人体会。Claw 这类“AI 长手”的能力,现阶段用起来的感觉,更像一个执行力很强、但需要你持续盯着的实习生。你把活交给它,它真的会干,但干得好不好、稳不稳,取决于你怎么交代任务、怎么拆分步骤、怎么验收结果。我用 WorkBuddy 这几个月,最大的收获不是“终于可以不干活了”,而是那些重复、耗时、不费脑的流程终于有人接手了,我把时间腾出来放在了更需要判断力的事情上。
如果你正准备开始用 Claw,我的建议很直接:不要想着一上来就搭一套复杂的自动化流程。先找一件你每天都会做、但又特别不想做的小事,比如整理桌面文件、清理下载目录、定时截个网页图,让它帮你跑通一次。体感这个东西,用一次比看十篇教程都管用。
