日记探索 · 2026-06-02
自动生成 · 深度分析版本
📅 概览
- 探索日期:2026-06-02(星期二)
- 探索条目数:6
- 原始链接:/Users/yantianlong/Documents/MinMetaSeek/20-日记/2026-06-02.md
🔍 深度探索
条目1:wurk.fun — AI代理微任务平台
① 定位背景
- 领域:Crypto + AI Agent微任务市场(Micro-Task Marketplace)
- 行业热度:🔥🔥🔥🔥(高)。AI Agent经济正在爆发,Agent需要人类做验证、数据标注、内容审核等微任务。WURK用Solana/USDC+x402协议+MCP支持,让AI代理直接雇佣人类。这是“去中心化众包+AI Agent”的交汇点,非常前沿。
- 核心竞争力:AI Agent可以直接用crypto支付人类完成任务;支持x402协议(浏览器支付)和MCP(OpenClaw skill输出),集成Solana/Tempo等多链;门槛极低,无需特殊技能即可接单。
② 理论支撑
- 核心技术:x402支付协议(HTTP 402 + crypto微支付)、MPP(Machine Payment Protocol)、Solana区块链、MCP(Model Context Protocol)
- 关键概念:AI Agent → 发任务 → 微支付(USDC)→ 人类接单完成。本质是“AI驱动的零工经济”的基础设施层。
③ 资源匹配
- 官方网站:https://wurk.fun
- Trustpilot评价:https://www.trustpilot.com/review/wurk.fun
- 博客介绍:https://wurk.fun/blog/wurk-fun-the-micro-task-platform-where-ai-agents-pay-real-humans-in-crypto-my-ho
- 社区:Solana生态、OpenClaw生态
④ 实践路径
学习实践计划:wurk.fun / AI Agent微任务平台
阶段一:认知(1-2天)
目标:理解AI Agent微任务经济的基本逻辑 动作: □ [ ] 浏览wurk.fun网站,理解平台功能、任务类型、支付流程 □ [ ] 阅读博客文章,了解x402协议和MCP如何工作 □ [ ] 理解Solana/USDC在微支付中的应用 输出:用30字概括“AI Agent雇佣人类的价值”
阶段二:上手(2-3天)
目标:试做一个任务或注册成为worker 动作: □ [ ] 注册wurk.fun账号 □ [ ] 浏览现有任务列表,了解需求方在招募什么 □ [ ] 尝试完成1-2个小任务,体验全流程 输出:成功接单并收到第一笔crypto支付
阶段三:应用(3-5天)
目标:作为任务发布方,用AI Agent发任务 动作: □ [ ] 研究如何通过OpenClaw skill集成WURK □ [ ] 设计一个适合AI Agent派发的微任务(如数据验证/内容审核) □ [ ] 实际发布任务并验收结果 输出:项目落地 + 复盘:AI Agent发任务vs传统众包效率对比
条目2:design-tests.robinebers.com — 设计测试工具集
① 定位背景
- 领域:前端设计测试 / UI自动化测试
- 行业热度:🔥🔥🔥(中高)。AI驱动的前端测试工具越来越火,但纯设计层面的测试(视觉回归、组件一致性检查)是蓝海。Robin Ebers 是前端设计社区活跃个人开发者。
- 核心竞争力:可能是聚焦设计本身的轻量测试工具(区别于Playwright/Cypress这类功能测试),偏向设计一致性和视觉回归验证。
② 理论支撑
- 核心技术:视觉回归测试(Visual Regression Testing)、截图比对、像素级差分分析、组件驱动开发(CDD)
- 关键概念:视觉一致性、UI组件库的自动化验收、Storybook集成、CSS/样式对比
③ 资源匹配
- 网站:https://design-tests.robinebers.com/
- 相关工具生态:Percy.io、Chromatic、BackstopJS(传统视觉回归工具)
- 社区:Robin Ebers可能有博客或Twitter/Bluesky分享设计测试心得
④ 实践路径
学习实践计划:设计测试工具
阶段一:认知(1-2天)
目标:理解视觉回归测试是什么以及为什么重要 动作: □ [ ] 访问design-tests.robinebers.com,了解工具功能 □ [ ] 对比Percy、Chromatic等主流视觉回归测试工具 □ [ ] 阅读“视觉回归测试最佳实践”相关文章 输出:用30字概括设计测试与功能测试的区别
阶段二:上手(2-3天)
目标:搭建一个简单demo,跑通设计测试流程 动作: □ [ ] 选一个前端项目(如Next.js/Vue项目) □ [ ] 集成design-tests工具或类似的BackstopJS □ [ ] 创建第一个截图基准,运行测试 输出:成功跑通一条视觉回归测试用例
阶段三:应用(3-5天)
目标:在实际项目中落地设计测试 动作: □ [ ] 为项目的主要UI组件建立视觉回归覆盖率 □ [ ] 集成到CI/CD(GitHub Actions自动截图比对) □ [ ] 编写一份团队可用的设计测试流程文档 输出:项目落地 + 自动化的视觉回归流水线
条目3:Agnes-Image-2.1-Flash — Sapiens AI 图像生成模型
① 定位背景
- 领域:AI图像生成(Text-to-Image / Image-to-Image)
- 行业热度:🔥🔥🔥🔥🔥(极高)。图像生成是最卷的AI赛道之一,Flux、Midjourney、DALL·E 3、Stable Diffusion 3持续迭代。Agnes作为API服务提供商,定位是低成本高质量的开源替代方案。
- 核心竞争力:支持文本生图和图生图双模式;Flash版本主打速度(快速推理);作为API服务而不是本地模型,降低使用门槛。
② 理论支撑
- 核心技术:扩散模型(Diffusion Models)、潜在空间扩散(Latent Diffusion)、UNet/Transformer混合架构、CFG(Classifier-Free Guidance)
- 关键概念:Image-2.1相比2.0的升级点、Flash加速推理(蒸馏/量化/步数减少)、API调用参数(prompt, negative prompt, seed, steps)
③ 资源匹配
- 官方文档:https://agnes-ai.com/doc/agnes-image-21-flash
- GitHub Skill:https://github.com/jomeswang/agnes-ai-skill(含代码示例)
- API接入:https://agnes-ai.com/ 获取API Key
- 对比参考:Agnes官网模型对比、Artificial Analysis排行榜
④ 实践路径
学习实践计划:Agnes Image模型创作
阶段一:认知(1-2天)
目标:理解Agnes Image的使用方式和能力边界 动作: □ [ ] 注册agnes-ai.com获取API Key □ [ ] 阅读API文档,理解text-to-image和image-to-image参数 □ [ ] 对比Agnes-Image-2.1-Flash与主流模型(Midjourney/Flux)的差异 输出:用30字概括Agnes Image的定位
阶段二:上手(2-3天)
目标:用API批量生成高质量图片 动作: □ [ ] 写脚本调用Agnes Image API生成第一张图 □ [ ] 试验不同参数(prompt工程、seed、steps)对结果的影响 □ [ ] 测试image-to-image(图生图/编辑)功能 输出:跑通API + 生成一组风格测试图
阶段三:应用(3-5天)
目标:将Agnes Image整合到实际创作/内容生产中 动作: □ [ ] 选一个应用场景(文章配图/产品图/社交媒体素材) □ [ ] 建立一条“prompt→生成→筛选”的流水线 □ [ ] 产出至少5张高质量成品图 输出:项目落地 + 复盘:AI生成图像的质量、成本、效率评估
条目4:Agnes-Video-V2.0 — Sapiens AI 视频生成模型
① 定位背景
- 领域:AI视频生成(Text-to-Video / Image-to-Video)
- 行业热度:🔥🔥🔥🔥🔥(极高)。2025-2026年是AI视频大爆发期,Sora、Kling、Runway Gen-3、Pika等疯狂内卷。Agnes Video V2.0 以 $0.30/分钟 的超低价位杀入市场,比Seedance 2.0便宜约28倍,在Artificial Analysis排行榜上进入前10。
- 核心竞争力:极低价格(价格破坏者)、原生音视频同步生成、支持文本→视频/图片→视频/多图视频/关键帧动画多种模式
② 理论支撑
- 核心技术:扩散视频生成(Diffusion Video)、时空注意力(Spatial-Temporal Attention)、3D-UNet、DiT架构
- 关键概念:异步视频任务(创建任务→轮询结果)、seed可重复性、提示词自动翻译为非英语提供支持
③ 资源匹配
- 官方文档:https://agnes-ai.com/doc/agnes-video-v20
- 价格/评测:https://wavespeed.ai/blog/posts/agnes-video-v2-0-price-disruptor-leaderboard/
- GitHub Skill:https://github.com/Yacey/agnes-ai-generation-skill
- 社区:Agens AI Discord / Agnes AI官方社交媒体
④ 实践路径
学习实践计划:Agnes Video AI视频创作
阶段一:认知(1-2天)
目标:理解Agnes Video的能力边界和使用流程 动作: □ [ ] 阅读Agnes Video V2.0文档,了解支持的模式(t2v/i2v/多图/关键帧) □ [ ] 理解异步任务创建+轮询的流程 □ [ ] 对比价格和质量:$0.30/分钟 vs Sora/Runway/Kling 输出:用30字概括Agnes Video的核心卖点
阶段二:上手(2-3天)
目标:用API生成第一个AI视频 动作: □ [ ] 获取API Key,调用text-to-video接口 □ [ ] 试验不同提示词的视频效果 □ [ ] 测试image-to-video(用已有图片生成视频) 输出:成功生成3段不同风格的AI视频
阶段三:应用(3-5天)
目标:用Agnes Video做内容创作实战 动作: □ [ ] 规划一个短视频脚本(30秒以内) □ [ ] 用Agnes Video生成所需片段 □ [ ] 剪辑合成一个可发布的短视频(可配合剪映/CapCut) 输出:一个成品短视频 + 复盘(质量/成本/时间)
条目5:MobileGym — 移动GUI Agent仿真平台
① 定位背景
- 领域:AI智能体(Agent)仿真环境 / 移动端GUI自动化 / 强化学习
- 行业热度:🔥🔥🔥🔥🔥(极高)。手机GUI Agent是2025-2026年最热门的AI Agent方向之一(Apple Intelligence、Android Agent、Anthropic Computer Use)。MobileGym定位是学术级仿真平台。
- 核心竞争力:28个模拟App + 416个任务模板;可编程状态(programmable state);次毫秒级确定性评分器;单机256个并行实例(≈400MB RAM/实例);Sim-to-Real验证(GRPO在Qwen3-VL-4B上+42.8分,Sim→Real保留95%效果)
② 理论支撑
- 核心技术:GUI Agent仿真环境、VRAM-level状态快照、确定性评分(deterministic judge)、大规模并行仿真、Sim-to-Real迁移、GRPO(Group Relative Policy Optimization)
- 关键概念:Verifiable simulation(可验证仿真)、Identical-state replication(同态复制)、Programmatic state verification(程序化状态验证)
③ 资源匹配
- GitHub:https://github.com/Purewhiter/mobilegym
- 官方网站:https://mobilegym.dev/
- 论文:MobileGym相关论文(GitHub README应该包含引用)
- 相关资源:AndroidEnv、AppAgent、CogAgent、Qwen3-VL系列模型
④ 实践路径
学习实践计划:MobileGym — 移动GUI Agent仿真
阶段一:认知(1-2天)
目标:理解MobileGym是什么、能做什么 动作: □ [ ] 阅读GitHub README,了解整体架构 □ [ ] 浏览官网mobilegym.dev,看演示/截图 □ [ ] 理解“verifiable simulation”和“programmatic state”的关键意义 输出:用30字概括MobileGym的核心价值
阶段二:上手(2-3天)
目标:本地部署并运行一个示例任务 动作: □ [ ] 克隆仓库,按照README部署环境 □ [ ] 运行一个基础demo(如打开模拟器、加载一个task template) □ [ ] 尝试自定义一个简单的任务场景 输出:成功跑通一个模拟任务
阶段三:应用(3-5天)
目标:用MobileGym做一个GUI Agent训练/测试小实验 动作: □ [ ] 选一个感兴趣的任务模板(如打开App→点击→验证结果) □ [ ] 接入一个VL模型(如Qwen3-VL-4B)做Agent推理 □ [ ] 分析模型在仿真环境中的表现,记录成功率 输出:实验报告 + 对GUI Agent能力的实际认知
条目6:Echobird + Codex → 接入DeepSeek(国内使用Codex)
① 定位背景
- 领域:AI编程工具代理/代码生成加速
- 行业热度:🔥🔥🔥🔥🔥(极高)。OpenAI Codex(原GitHub Copilot的底层技术)2026年全面开放,成为AI编程的核心工具。但国内用户受网络限制,接入国产大模型的需求非常旺盛。
- 核心竞争力:Echobird作为模型网关(Model Gateway),在Codex和DeepSeek之间做协议转换,使国内用户无需梯子就能用Codex。DeepSeek V4 Pro性价比远超OpenAI官方。
② 理论支撑
- 核心技术:模型协议转换(OpenAI兼容API ↔ 第三方API)、代理桥接、Echobird的Model Nexus统一管理多模型端点
- 关键概念:Echobird(本地代理工具,接管Codex/Cursor/Windsurf的模型配置)、DeepSeek API / DeepSeek V4 Pro、协议兼容性问题(为什么直接填API Key不行?因为协议格式不同)
③ 资源匹配
- CSDN教程:https://blog.csdn.net/gaoguosheng/article/details/161524026
- Vaitk完整指南:https://vaitk.com/blog/codex-deepseek-third-party-api/
- 知乎实战:https://zhuanlan.zhihu.com/p/2042306303096270930
- Echobird GitHub:搜索“Echobird Releases”下载
- DeepSeek官网:https://deepseek.com/(获取API Key)
- 替代方案:Codex++、CCX(类似作用的工具)
④ 实践路径
学习实践计划:Codex + DeepSeek 国内使用方案
阶段一:认知(1-2天)
目标:理解架构和方案选择 动作: □ [ ] 阅读CSDN保姆级教程,了解Codex+Echobird+DeepSeek的整体架构 □ [ ] 对比Echobird、Codex++、CCX三种方案优劣 □ [ ] 去deepseek.com注册并获取API Key 输出:用30字概括“Codex在国内用DeepSeek”的原理
阶段二:上手(2-3天)
目标:配置环境并跑通Codex 动作: □ [ ] 下载安装Echobird(从GitHub Releases) □ [ ] 在Echobird Model Nexus添加DeepSeek配置(填入API Key和Model ID) □ [ ] 启动Codex,验证DeepSeek模型成功接入 输出:Codex正常运行,用DeepSeek写一段代码
阶段三:应用(3-5天)
目标:深度使用Codex + DeepSeek做项目开发 动作: □ [ ] 用Codex写一个完整的项目(如一个web小工具/爬虫/自动化) □ [ ] 测试DeepSeek V4 Pro在代码生成上的效率和质量 □ [ ] 对比DeepSeek vs OpenAI原版在Codex中的体验差异 输出:项目落地 + 一份使用对比报告
📊 综合建议
最值得投入的方向
按大哥背景(想赚钱、做内容、关注AI工具)排序:
🥇 第1优先:Codex + DeepSeek(条目6)
- 原因:直接提升编程效率!你现在每天写代码,Codex+DeepSeek能让你进步速度翻倍
- 投入产出比最高,几小时配置就能持续受益
🥈 第2优先:Agnes Video V2.0 视频创作(条目4)
- 原因:$0.30/分钟的价格极低,适合做内容创作实验
- 大哥想做内容、做短视频变现,低成本AI视频生成就是切入点
- 配合剪映,可以快速产出短视频内容
🥉 第3优先:Agnes Image 2.1 Flash(条目3)
- 原因:内容创作的补充工具,做配图/封面/社交媒体素材
- 可以和生产流程绑定
🏅 第4优先:wurk.fun(条目1)
- 原因:前沿赛道,了解AI Agent经济形态。但暂时偏概念验证阶段
- 适合关注+小试,不宜all in
🏅 第5优先:MobileGym(条目5)
- 原因:学术级项目,门槛较高。适合AI Agent方向的深度研究
- 如果大哥对GUI Agent方向感兴趣可以深入了解
🎯 第6优先:design-tests(条目2)
- 原因:前端设计测试,偏工具链提升。如当前项目有前端开发需求则优先级上升
建议优先级
- 今晚/明天:配置Codex + DeepSeek(1h配置,长期受益)
- 本周:Agnes Video注册+测试视频生成(产出1个短视频)
- 本周-下周:Agnes Image整合到创作流程
- 本月内:了解wurk.fun机制(1-2h足够了)
- 按需:MobileGym和design-tests根据项目需求再深入
预计投入时间
- Codex + DeepSeek:2-3小时配置和熟悉
- Agnes Video创作:5-8小时出第一个成品视频
- Agnes Image适用:3-5小时整合进流程
- wurk.fun了解:1-2小时
- MobileGym深入研究:8-12小时(偏高门槛)
💡 核心建议:先把Codex+DeepSeek搞起来!这是最短路径上能产生最大价值的工具升级。然后下周全力跑一次AI视频创作的MVP——从Agnes Video出片到剪映剪辑到发布,走通一次“AI内容→发布”的闭环。
✅ 日记深度探索完成:2026-06-02