
两笔订单都叫 Lisa Wong,它先问你要哪一笔,再写入
「在 records.txt 里找到 Lisa Wong 的订单,按 Date、Customer、Order、Amount 追加进 ledger.csv 并保存。」
猜错就会写错一行;先问一句就能避免。
DeskMind 会看屏幕、想下一步、动手操作,靠的是跑在你 Mac 上的小模型。任务有两种理解时,它先问你一句,不瞎猜。

每一步先由 0.8B 判断,难的再交给 4B 复核。两个模型都在本机运行,不走云端,也不按次付费。
每一步是一道选择题,模型给每个选项打分而不是写文字,所以每个选项都有概率。没把握就交给 4B 或先问你,任何 agent 都能通过 /v1/systemone 接入。
Eyes、Brain、Hands 和 Mac App 全部开源,连同给它们打分的 Bench。每个成绩都附样本量,可以自己复现。
一个循环,三个部分,装在一个 App 里。另有一套评测,在真实桌面上衡量整个循环。
用发布版模型录制。视频里只缩短了等待,其他一律不剪。

「在 records.txt 里找到 Lisa Wong 的订单,按 Date、Customer、Order、Amount 追加进 ledger.csv 并保存。」
猜错就会写错一行;先问一句就能避免。

「打开网易云音乐,搜索 Billie Eilish 的 BIRDS OF A FEATHER,播放现场版。」
没有接口,只能看屏幕:在一堆同名歌曲里认出现场版。

「用 TextEdit 打开附带文件夹里的 parts.csv,把表格的四行按数量从高到低追加进去,然后保存并关闭。」
跨两个应用:在 Safari 里读,从文件夹打开文件,写入、保存、关闭。
在一台 Mac(M4 Pro,48 GB)上,用发布版 0.8B → 4B 路由测得。样本不大,做不好的地方也写在下面。
默认在本机推理。下面写清楚了什么情况下数据会离开你的电脑。