Search: #开发工作流

  1. AI Agent 框架如何实现崩溃自愈?深入 Pi 的 Durable Harness v2 架构设计在构建复杂且长周期的 AI Agent 系统时,进程崩溃、外部 API 超时以及并发冲突是不可避免的挑战

    AI Agent 框架如何实现崩溃自愈?深入 Pi 的 Durable Harness v2 架构设计

    在构建复杂且长周期的 AI Agent 系统时,进程崩溃、外部 API 超时以及并发冲突是不可避免的挑战。开源 AI Agent 工具库 Pi(earendil-works/pi)发布了其核心执行引擎 AgentHarness v2 的设计规范,全面重构了 Agent 的持久化、并发与容错模型。

    ---

    核心设计亮点

    1. 确定性持久化与崩溃恢复(Durable Runs)
    预写意图(Intent-first):在执行任何副作用(LLM 请求、工具调用)之前,必须先持久化一条意图记录;执行完成后再将结果作为节点提交。
    零中间态:无论是调用中断、系统崩溃还是上下文超限,重启后都能根据日志精确定位到最近的安全边界进行恢复或重试,绝不产生不一致的脏状态。

    2. Lanes(多泳道并行架构)
    • 引入类似 Git 分支的 Lane 概念。一个会话(Session)拥有唯一的共享对话树,但可以在上面并发运行多个独立的 Lane(如 Slack 频道下的不同 Thread)。
    • 每个 Lane 拥有独立的 Leaf 指针与操作日志,保证多任务互不干扰且免受竞态冲突影响。

    3. 对 KV Cache 极度友好的追加模式(Append-Only Context)
    • 运行中所有交互和配置修改均以追加(Append)形式进入上下文,避免因中间插入导致模型端 KV Cache 失效,显著降低 Token 消耗与延迟。
    • 只有在显式触发压缩(Compaction)时才做重整。

    4. 单步驱动与确定性测试(Deterministic Stepping)
    • 支持 manual 驱动模式:Agent 的每一个网络请求、工具执行、Hook 回调和存储写入都会在虚拟门控前暂停。
    • 开发者和测试套件可以一步步单步调试,任意注入输入或模拟崩溃,彻底消除异步 Agent 系统的难以复现的隐蔽 Bug。

    5. 清晰的职责分离
    Session Tree:只负责只增的对话与事实树,不掺杂编排逻辑。
    Operation Logs:记录状态机流水,专为崩溃恢复服务。
    Hooks 与 Events 分立:Hooks 负责拦截与修改执行流,Events 负责单向、实时的 UI 状态订阅。
    多存储后端:原生适配内存、JSONL 与 SQLite,并向下兼容 v3 格式。

    ---

    对于正在探索长时间运行 Agent、多分支 Agent 或企业级容错工作流的开发者来说,Pi 的 Harness v2 提供了一套非常严谨、工业级的状态机与架构参考范式。

    完整设计文档:https://github.com/earendil-works/pi/blob/harness-v2/j4/packages/agent/docs/harness-v2.md

    #AIAgent #系统架构 #开源项目 #LLM #状态机 pi/packages/agent/docs/harness-v2.md at harness-v2/j4 · earendil-works/pi

  2. 你的网站对 AI 智能体友好吗?Vercel 推出评估工具 Is Agentic随着 AI Agent(智能体)逐渐成为网络内容的重要消费者与使用者,网站不仅要为人类设计,也需要对 AI 更加友好

    你的网站对 AI 智能体友好吗?Vercel 推出评估工具 Is Agentic

    随着 AI Agent(智能体)逐渐成为网络内容的重要消费者与使用者,网站不仅要为人类设计,也需要对 AI 更加友好。Vercel 联手 Ora 推出了 Is Agentic,一个专门评估网站“Agent 就绪度”(AI Agent Readiness Score)的在线测试工具。

    核心亮点:

    多维度能力检测:评估 AI Agent 在网站上的发现、检索、理解与交互体验。主要涵盖服务端渲染(SSR)、清晰的语义化结构、规范的 HTTP 响应及可恢复的错误处理等基础指标。
    动态匹配,不滥扣分:根据网站实际能力进行推荐项检测(如 API、OAuth 认证、GraphQL、MCP Server 支持等)。若网站本就不包含特定接口,不会因此扣分。
    具象化诊断与路径观察:不仅给出具体改进建议,还会记录 Agent 实际浏览该网站时的操作路径与遇到的阻碍(Friction)。
    面向 Agent 优化输出:支持直接以 Markdown、JSON API 形式读取报告,并提供了专属的 MCP(Model Context Protocol)Server,方便将检测能力直接集成到各类 Agent 工作流中。

    输入网址即可快速测试你的网站对 AI 智能体的易用程度,并获取针对性的优化建议。

    访问地址:https://is-agentic.com

    #AIAgent #Web开发 #Vercel #MCP #开发者工具 Is Agentic: AI Agent Readiness Score for your Site and App

  3. 通俗解读:什么是 AI 时代的「Agent Harness」?业界常用一个极简公式来定义智能体:Agent = Model + Harness

    通俗解读:什么是 AI 时代的「Agent Harness」?

    业界常用一个极简公式来定义智能体:Agent = Model + Harness

    如果把大模型(Model)比作攀登者的核心力量,那么 Harness(原意为登山安全带/挽具) 就是为你提供支撑、挂载工具并确保安全的整套装备。

    在 AI 领域,Agent Harness 是为模型提供运行环境的软件外壳。它主要承担四个核心职能:

    1. 系统提示(System Prompt):像给新员工的工作指引,规范模型在特定场景下的行为准则。
    2. 工具挂载(Tools):为模型提供搜索、写代码、发邮件等能力接口,并由模型自主判断何时调用。
    3. 自主循环(Agentic Loop):构建「理解任务 ➔ 调用工具 ➔ 评估结果 ➔ 自主修正 ➔ 交付成果」的完整工作流闭环。
    4. 模型转换层(Translation Layer):抹平不同大模型(OpenAI、Anthropic、开源模型等)的接口差异,支持灵活切换与混用。

    为什么 Harness 越来越重要?
    大模型往往掌握在少数巨头手中,但 Harness 可以开源并运行在本地。借助像 Pi、OpenClaw 这类中立的开源框架,用户能够将控制权掌握在自己手中,按需定制属于自己的 AI 工作流。

    阅读原文:https://earendil.com/posts/what-is-a-harness/

    #AI智能体 #Agent #人工智能 #开源技术 What is a Harness? | EARENDIL

  4. 告别合盖中断:为 AI 编程智能体打造的专属后台运行环境 Herdr在使用 Claude Code、Codex 等 AI 编程助手时,许多人经常遇到两个痛点:一旦合上笔记本电脑或断开连接任务就会中断;同时跑多个 Agent 时,很难及时发现哪一个正在等待输入确认

    告别合盖中断:为 AI 编程智能体打造的专属后台运行环境 Herdr

    在使用 Claude Code、Codex 等 AI 编程助手时,许多人经常遇到两个痛点:一旦合上笔记本电脑或断开连接任务就会中断;同时跑多个 Agent 时,很难及时发现哪一个正在等待输入确认。

    Herdr 正是为解决这些问题而生的智能体运行时(Runtime)。它作为一个后台服务运行,接管终端会话,让你的 AI 智能体可以全天候自主工作。

    核心特性

    后台常驻,合盖不掉线:终端直接运行在 Herdr 后台服务中,即使关闭电脑屏幕、网络断开甚至系统重启,会话与分屏布局都能完整保留并继续执行。
    状态感知,告别逐屏排查:自动识别每个窗格中 Agent 的实时状态(工作中 / 等待输入 / 空闲),当某个 Agent 需要人工确认时一目了然,无需在多个终端间来回切换。
    Agent 原生协作:提供统一的 CLI 与 Socket API,不同的 Agent 可以自主分屏、相互唤起并协同处理复杂任务。
    开箱即用,无缝兼容:无需改变原有的使用习惯,开箱支持 Claude Code、Cursor、Codex、Copilot 等 20 多种主流 Agent CLI,单二进制文件支持 macOS、Linux 和 Windows。

    安装只需一行命令即可接入现有的开发流,让 AI 智能体真正具备独立持续干活的能力。

    原链接:https://herdr.dev/

    #AI编程 #Agent运行时 #开发者工具 #ClaudeCode #终端工具 Herdr: the runtime coding agents run on

  5. anydoc:毫秒级将主流文档转换为干净 Markdown 的 Rust 利器anydoc 是由网页解析平台 Firecrawl 开源的一款极速文档转换库

    anydoc:毫秒级将主流文档转换为干净 Markdown 的 Rust 利器

    anydoc 是由网页解析平台 Firecrawl 开源的一款极速文档转换库。它完全基于 Rust 编写,旨在将 Word、PowerPoint、Excel、PDF、EPUB、RTF 及 CSV 等多种主流文档格式,统一转换为干净、规范的 GitHub 风格 Markdown(GFM)。

    核心亮点:

    极致性能:纯 Rust 编写,不依赖重量级 AI 模型或外部云服务,单次转换的中位数时间小于 5 毫秒。
    📦 多端支持:除了 Rust 原生库外,还提供了 Node.js、Python 绑定以及开箱即用的 CLI 命令行工具。
    🤖 AI Agent 友好:支持作为 Agent Skill 一键集成(例如使用 npx skills),方便 AI 智能体直接读取和理解本地文档。
    🔍 智能格式检测:通过文件头字节自动识别格式,即使文件后缀名错误也能精准转换。
    📊 基准测试领先:在与 Pandoc、Docling、MarkItDown 等工具的对比测试中,anydoc 在格式支持完整度与转换速度上表现十分抢眼。

    无论是用于构建 LLM 知识库的数据预处理,还是日常的文档清理,anydoc 都是一个非常高效的开发者工具。

    项目地址:https://github.com/firecrawl/anydoc

    #Markdown #Rust #文档转换 #开发工具 #开源项目 GitHub - firecrawl/anydoc: Convert Word, PowerPoint, Excel, OpenDocument, RTF, EPUB, CSV, and PDF to clean Markdown. Built in Rust…

  6. OpenConnector:让 AI Agent 轻松连接万物的开源授权网关在构建 AI Agent 时,如何安全、高效地让它连接各种第三方 SaaS 服务(如 GitHub、Gmail、Notion、Slack 等)?Composio 的开源替代方案 —— OpenConnector 带来了一个优雅的解法

    OpenConnector:让 AI Agent 轻松连接万物的开源授权网关

    在构建 AI Agent 时,如何安全、高效地让它连接各种第三方 SaaS 服务(如 GitHub、Gmail、Notion、Slack 等)?Composio 的开源替代方案 —— OpenConnector 带来了一个优雅的解法。

    OpenConnector 是一个专为 AI Agent 设计的开源连接授权网关。通过它,你只需配置一次用户账号,即可向 Agent 开放包含 1,000+ 服务商、超过 10,000 个预置 Action 的共享目录。

    核心亮点

    安全隔离:敏感凭证、OAuth 权限和运行日志均保留在可审计的运行时内,Agent 无法直接接触,有效保障数据安全。
    多端友好:提供 TypeScript SDK、oo CLI 工具,原生支持 MCP(Model Context Protocol)以及标准 HTTP/OpenAPI 接口。
    灵活部署:支持本地 Docker 运行,也支持部署在 Fly.io、Cloudflare Workers 等无服务器(Serverless)平台,或直接使用官方托管版本。
    可视化管理:自带直观的 Web Dashboard,方便浏览连接器、配置凭证、生成 Runtime Token 以及实时监控调用日志和异常。

    对于正在开发 Agent 应用,且需要稳定、安全地对接用户日常工作流软件的开发者来说,这是一个非常值得尝试的基础设施。

    原链接:https://github.com/oomol-lab/open-connector

    #AIAgent #开源工具 #API网关 #MCP GitHub - oomol-lab/open-connector: Open-source auth gateway connecting 1500+ SaaS providers to AI agents through SDK, CLI, MCP…

  7. 开源 AI 模型安全吗?Cognition 发布可信度评估报告低成本且广泛可用的开源模型正在推动 AI 应用的爆发,但它们的安全性和可信度也引发了广泛担忧

    开源 AI 模型安全吗?Cognition 发布可信度评估报告

    低成本且广泛可用的开源模型正在推动 AI 应用的爆发,但它们的安全性和可信度也引发了广泛担忧。为此,智能体开发商 Cognition 建立了一套模型可信度评估体系,并对其基于开源模型 Kimi K2.7 Code 训练的软件工程模型 SWE-1.7 进行了深度测试。

    测试主要从以下三个维度展开:

    1. 政治宣传与审查过滤

    测试使用包含 145 个敏感问题的测试集,评估模型在不同语言下的中立性。结果显示,一些来自中文社区的开源模型在中文语境下容易输出带有偏向性的特定叙事。而经过优化后的 SWE-1.7,其答复中立性表现已经与 GPT 5.5、Claude Opus 等顶级闭源模型不相上下。

    2. 恶意请求的拒绝能力

    在面对具有潜在危害的开发请求(例如编写用于非法监控特定人群的代码)时,原始开源模型(如 Kimi K2.7)往往会盲目顺从,甚至主动完善监控功能。而 SWE-1.7 则能准确识别风险并坚决予以拒绝。

    3. 针对特定对象的“潜在安全隐患”

    此前有研究称,部分开源模型在面对特定用户身份(如某些政府机构或组织)时,可能会故意降低代码安全性。Cognition 在其沙箱运行环境中进行了验证,结果表明,在完整的智能体(Agent)工作流中,不同“人设”对模型生成的代码安全性的实际影响极小,SWE-1.7 在各种背景下均能保持稳定、一致的代码质量。

    结论
    开源模型本身并不是天然不安全的。只要在后训练(Post-training)阶段投入足够的安全对齐与精心设计,基于开源模型微调的产品完全可以达到甚至超越顶级闭源模型的安全与可信标准。

    https://cognition.com/blog/measuring-open-source-model-trustworthiness

    #人工智能 #开源模型 #AI安全 #大模型 #Cognition Measuring the Trustworthiness of Open-Source-Derived Models

  8. 极简终端 AI 编码助手,带你读懂 Agent 的核心设计:TauHugging Face 开源的 Tau 是一款运行在终端(Terminal)里的 AI 编码助手

    极简终端 AI 编码助手,带你读懂 Agent 的核心设计:Tau

    Hugging Face 开源的 Tau 是一款运行在终端(Terminal)里的 AI 编码助手。只需输入简单的需求,它就能帮你读取文件、修改代码、执行 Bash 命令并记录会话历史。

    不同于庞大复杂的商业项目,Tau 的核心定位是一个教学型项目。它的代码极其精简、层级分明,非常适合开发者用来理解“AI 编码 Agent 是如何从零构建的”。

    核心特性:

    极简且模块化的架构:代码分为 tau_ai(模型适配)、tau_agent(核心大脑与工具流)和 tau_coding(TUI 与命令行包装器)三层,核心大脑完全独立,可轻松作为第三方库引入。
    终端交互式操作:内置基于 Textual 的命令行 TUI 界面,支持 /login 登录、模型切换以及流式输出。
    多模型支持:支持对接 OpenAI、Anthropic、OpenRouter、Hugging Face 以及兼容 OpenAI 格式的本地大模型。
    持久化会话管理:通过 JSONL 格式安全存储每一次会话,支持中断恢复与分支操作。

    如果你想拥有一个轻量级的命令行开发助手,或是想动手写一个自己的 AI Agent,Tau 是一个绝佳的起点。

    项目链接:https://github.com/huggingface/tau

    #AI #Agent #Python #开源项目 #编程助手 GitHub - huggingface/tau: A Python port of Pi’s minimalist coding agent.

  9. 面向 Codex 用户的本地无限画布插件:Cowart如果你在使用 Codex 并且需要一个好用的可视化工具,不妨关注一下 Cowart

    面向 Codex 用户的本地无限画布插件:Cowart

    如果你在使用 Codex 并且需要一个好用的可视化工具,不妨关注一下 Cowart。它是一个基于 tldraw 开发的本地无限画布插件,专门用来帮助开发者在本地进行构思、标注、生成以及迭代图片。所有画布数据都默认保存在你当前项目的 canvas/ 目录下,安全又私密。

    核心功能包括:

    本地无限画布:在 Codex 中一键拉起本地 tldraw 可视化页面。
    本地持久化:所有的画布数据与图片资源都会跟着你的项目走。
    AI 占位符生成:在画布里创建一个 AI 占位框,写下提示词,Codex 就会根据比例自动填入生成的图像。
    标注图迭代:在画布里随手画标注或箭头,截图发给 Codex,它就能直接帮你生成修改后的干净新图并并排摆放。
    MCP 工具支持:支持通过 MCP 接口自动读取状态、保存或插入图片,实现工作流自动化。

    对于想要摆脱云端束缚,又想拥有丝滑 AI 绘图/修改体验的 Codex 用户来说,这绝对是一个值得尝试的效率利器。

    https://github.com/zhongerxin/Cowart

    #Codex #无限画布 #AICanvas #开源项目 #效率工具 GitHub - zhongerxin/Cowart

  10. 像使用 shadcn/ui 一样构建 AI Agent:开源模板库 agentcn如果你喜欢 shadcn/ui 的组件化设计,那一定不要错过 agentcn

    像使用 shadcn/ui 一样构建 AI Agent:开源模板库 agentcn

    如果你喜欢 shadcn/ui 的组件化设计,那一定不要错过 agentcn。这是由 shadcn-labs 推出的开源、可定制且生产可用的 AI Agent 模板库。它将 shadcn 的设计理念带入到了 AI 智能体开发领域。

    项目亮点:

    零配置开箱即用:提供合理的默认设置,支持一键命令快速初始化。
    无缝兼容 shadcn CLI:采用相同的 Registry 格式,使用体验与 shadcn/ui 高度一致。
    强大的底层支撑:基于 Eve 和 Flue 框架构建,完整包含指令、工具、技能和工作流。
    可组合与在线预览:支持通过声明式组件构建复杂的交互界面,并在文档中提供直接运行的实时预览。

    对于想要快速、规范地搭建 AI Agent 的开发者来说,这是一个非常值得尝试的脚手架工具。

    https://github.com/shadcn-labs/agentcn

    #AIAgent #开源项目 #前端开发 #shadcn #人工智能 GitHub - shadcn-labs/agentcn: shadcn/ui, but for building agents. 🤖

  11. omp:直接集成 IDE 能力的终端 AI 编码助手oh my pi (omp) 是一个专为终端设计的开源 AI 编码智能体

    omp:直接集成 IDE 能力的终端 AI 编码助手

    oh my pi (omp) 是一个专为终端设计的开源 AI 编码智能体。它不仅是一个代码生成器,更是一个深度集成 IDE 工具的“全能型选手”,旨在为开发者提供开箱即用、无缝连接的终端开发体验。

    核心亮点:

    深度集成 IDE 工具链:内置 LSP(Language Server Protocol),AI 能够像在 IDE 中一样精准进行跨文件重命名与格式化;同时支持 DAP(Debug Adapter Protocol),可以直接启动调试器(如 lldb, dlv, debugpy)进行单步调试和堆栈排查。
    创新的 Snapcompact 图像压缩:当对话历史过长时,omp 不使用 LLM 进行文本总结,而是将历史记录渲染成极其微小的像素字体 PNG 图像,并发送给多模态模型读取。这一技术能够确保上下文细节不丢失,且仅消耗约 1/3 的 Token 成本。
    强悍的 Rust 原生引擎:核心由约 5.5 万行 Rust 代码构建,搜索、shell、AST 分析等高频操作均在进程内完成,避免频繁 fork 子进程,效率极高。
    本地化记忆与离线整理:使用本地 SQLite 矢量记忆库,并使用本地的小模型(如 Qwen-1.7B / Gemma-1B)在本地整理记忆与会话标题,数据不离设备。
    强大的协作与扩展性:支持通过 /collab 实现端到端加密的实时会话共享;兼容多种主流编辑器规则(如 Cursor, Cline, Copilot),甚至可以通过 ACP 协议直接在 Zed 编辑器中驱动终端中的同一个 omp 实例。

    原链接:https://omp.sh/

    #AI编码助手 #编程工具 #Rust #开源项目 #智能开发 omp — a coding agent with the IDE wired in

  12. Flue:构建下一代 AI Agent 的 TypeScript 架构框架Flue 提出了一个核心公式:Agent = Model + Harness

    Flue:构建下一代 AI Agent 的 TypeScript 架构框架

    Flue 提出了一个核心公式:Agent = Model + Harness。它不仅仅是一个简单的 SDK,而是一个专为构建自主 Agent 设计的“可编程治理框架”(Harness),旨在让开发者能够轻松打造像 Claude Code 或 Codex 这样具备规划、环境感知和执行能力的强力工具。

    核心特性:

    高度可编程: 使用 TypeScript 编写 Agent 逻辑,支持定义复杂的技能(Skills)、工作流和多 Session 管理。
    自带沙箱环境: 提供内置的虚拟沙箱或连接远程沙箱(如 Daytona),让 Agent 安全地执行 Bash 命令、读写文件或运行代码。
    安全与隐私: 采用精细的权限控制,确保敏感的 API Token 不会被模型或沙箱环境直接接触。
    跨平台部署: 编写一次逻辑,即可部署为 HTTP 服务,或在 CLI、GitHub Actions、Cloudflare Workers 等多种环境运行。

    与其使用通用的成品 AI 工具,Flue 鼓励开发者根据特定的产品需求、数据和工作流,构建完全属于自己的定制化 Agent。

    https://flueframework.com/

    #AI #Agent #TypeScript #开发工具 #开源项目 Flue — The Open Agent Framework

  13. Paseo:随时随地指挥你的 AI 编程助手想要在离开工位时也能继续推进代码进度?Paseo 是一款开源、自托管的 AI 编程 Agent 调度平台,让你能够从手机、桌面或终端轻松管理和运行 AI 助手

    Paseo:随时随地指挥你的 AI 编程助手

    想要在离开工位时也能继续推进代码进度?Paseo 是一款开源、自托管的 AI 编程 Agent 调度平台,让你能够从手机、桌面或终端轻松管理和运行 AI 助手。

    主要功能亮点:

    全平台覆盖:支持 iOS、Android、桌面端及 Web,甚至可以直接通过 CLI 脚本化运行,实现多端无缝衔接。
    集成主流 Agent:完美支持 Claude Code、Codex 和 OpenCode 等主流 AI 编程助手,保留原有的技能和配置。
    隐私与安全:代码始终保留在你的本地机器上,支持端到端加密中继,确保远程连接时的代码安全。
    本地语音交互:内置完全本地化的语音识别与合成技术,无需将语音数据上传云端即可实现指令下达。
    开发者友好:支持键盘快捷键优先操作、Git 工作流隔离(Worktrees)以及全方位的命令行支持。

    Paseo 是一款纯粹的开源工具,不直接调用推理 API,而是作为官方 CLI 的透明调度层,既自由又强大。

    https://paseo.sh/

    #AI编程 #开源项目 #Paseo #开发者工具 #人工智能 Paseo – Run Claude Code, Codex, Copilot, OpenCode from anywhere

  14. CursorBench:Cursor 如何更贴近真实开发来评估模型质量开发者正在把更长、更复杂的编程任务交给智能体:跨多个文件、工具和步骤

    CursorBench:Cursor 如何更贴近真实开发来评估模型质量

    开发者正在把更长、更复杂的编程任务交给智能体:跨多个文件、工具和步骤。Cursor 认为,评测方式也必须随之升级,才能真实反映“好用与否”。

    Cursor 的做法是 线上 + 线下 的混合评测闭环:

    线下:CursorBench(内部基准)
    基于工程团队的真实 Cursor 会话构建,而不是从公开代码库抽题。因为更贴近实际工作流、信息更不充分且常带歧义,CursorBench 往往能更好地区分前沿模型,并衡量多维能力(正确性、代码质量、效率、交互行为等)。

    线上:真实流量的受控实验
    用于捕捉线下评测遗漏的退化:例如线下评分器判“正确”,但开发者实际体验变差。Cursor 会用多类代理指标(交互信号 + 输出质量信号)综合观察,并通过消融实验归因(如移除语义搜索工具来定位其关键场景)。

    为什么不太依赖公开基准?Cursor 指出三类常见问题:

    1. 任务不匹配:许多基准仍偏向“修 bug”或“解谜题”,与真实开发请求脱节。
    2. 评分困难:真实请求常有多种正确解,固定答案容易误伤合理方案。
    3. 数据污染:公开仓库题目容易进入训练数据,分数被抬高;甚至出现“记忆补丁”与测试缺陷等问题。

    下一步,Cursor 预计开发会更多转向“长时运行智能体”。他们也计划让 CursorBench 适配更长任务,并解决成本、可复现性、以及离线结果与真实体验之间的差距。

    原文链接:https://cursor.com/cn/blog/cursorbench

    #模型评测 #编程智能体 #基准测试 #Cursor #开发者体验 How we compare model quality in Cursor · Cursor

  15. GitHub Agentic Workflows:用自然语言写 GitHub Actions 的“智能工作流”GitHub 开源项目 gh-aw(GitHub Agentic Workflows),主打一个思路:用自然语言 Markdown 编写“代理式(agentic)工作流”,然后直接在 GitHub Actions 里运行,让 AI 代你完成仓库中的重复性任务

    GitHub Agentic Workflows:用自然语言写 GitHub Actions 的“智能工作流”

    GitHub 开源项目 gh-aw(GitHub Agentic Workflows),主打一个思路:用自然语言 Markdown 编写“代理式(agentic)工作流”,然后直接在 GitHub Actions 里运行,让 AI 代你完成仓库中的重复性任务。

    它提供的核心价值包括:

    更低门槛的工作流编写方式:用 Markdown 描述要做什么,而不是从零写复杂的 YAML/脚本
    更强调安全的执行模型(Guardrails):默认只读权限;写入操作需要通过经过清洗的 safe-outputs;并配套多层防护(输入净化、工具白名单、编译期校验、网络隔离、供应链安全等)
    完善的文档与上手路径:官方提供 Quick Start 与完整文档,方便快速跑通示例并理解整体机制
    生态配套
    AWF(Agent Workflow Firewall):限制与记录代理的网络访问(出站控制)
    MCP Gateway:统一转发 MCP(Model Context Protocol)服务调用,便于集中管理访问

    适合关注 AI + DevOps、希望把“AI 介入仓库日常操作”做得更可控、更工程化的团队参考与尝试(同时也要保持必要的人类监督)。

    原链接:https://github.com/github/gh-aw

    #GitHubActions #AI自动化 #工作流 #安全工程 #开源项目 GitHub - github/gh-aw: GitHub Agentic Workflows

  16. Entire:把 AI 编程对话“写进”每一次 Git 提交用 AI 写代码时,最容易丢的不是代码,而是“为什么这么写”的上下文

    Entire:把 AI 编程对话“写进”每一次 Git 提交

    用 AI 写代码时,最容易丢的不是代码,而是“为什么这么写”的上下文。Entire 提供一个思路:在你正常的 git 工作流里,把每次 AI agent 会话自动记录下来,并与对应的 commit 绑定,形成可搜索的历史记录。

    它能做什么?

    自动捕获会话:在每次 push 时记录 AI agent 的会话内容,并和提交一起关联。
    不改变你的工作方式:通过 CLI 接入现有工具链,尽量减少上下文切换。
    支持多种 agent:目前支持 Claude CodeGoogle Gemini;OpenAI Codex 等集成在路上。
    把“意图”留在仓库里:官方强调记录会直接存进 git 历史,不依赖额外托管服务或外部数据库。

    安装方式(官网给出的命令)

    curl -fsSL https://entire.io/install.sh | bash

    适合希望团队更容易复盘决策、追踪 AI 产出过程、减少重复踩坑的工程项目。

    原链接:http://entire.io/

    #Git #AI编程 #开发工具 #工程效率 #CLI Entire · A new developer platform is coming

  17. Stripe「Minions」:一键生成、端到端交付的无人值守编码代理Stripe 在内部打造了一套名为 Minions 的编码代理:从接到任务到产出可评审的 PR,全程几乎无需人类介入

    Stripe「Minions」:一键生成、端到端交付的无人值守编码代理

    Stripe 在内部打造了一套名为 Minions 的编码代理:从接到任务到产出可评审的 PR,全程几乎无需人类介入。现在,Stripe 每周有超过 1000 个合并的 PR 是由 Minions 从头到尾生成的(人类负责 Review,但不写代码)。

    为什么要自研?

    在 Stripe 这种超大规模、强约束的工程环境里,“从零写个原型”和“在成熟巨型代码库里安全改动”完全不是一回事:

    • 代码库规模巨大(数亿行),栈也相对小众:大量后端是 Ruby + Sorbet,还有大量 Stripe 自研库,LLM 天然不熟
    • 业务风险极高:Stripe 的代码承载着 每年超过 1 万亿美元 的支付规模,并受金融合规与监管约束
    • 既要让代理“会写”,也要让它“按规矩写、能跑通、能过 CI”,并与既有研发流程深度结合

    工程师怎么用?

    最常见的入口是 Slack

    • 在讨论线程里 @Slack App 就能发起 Minion,它会读取整个线程与相关链接作为上下文
    • 也集成到内部系统里:文档平台、Feature Flag、工单系统等
    例如 CI 发现 flaky tests,会生成工单,直接提供按钮让 Minion 去修

    完成后,Minion 会:

    • 创建分支 → 推送 → 跑 CI → 按模板生成 PR

    如果效果不理想,人类可以补充指令让它再改;即使不完美,也常常是很好的“可用起点”。

    Minions 背后怎么运作(要点版)

    Stripe 的思路是:把“创意生成”交给 LLM,把“必须可靠执行的步骤”交给确定性工具链

    • 运行环境:在隔离的 devbox 中执行(10 秒内可启动,预热并预载代码与服务),与生产与公网隔离,便于并行
    • Agent 框架:基于 Block 的开源编码代理 goose 的 fork,并做了强定制
    • 规则与上下文:读取各类 agent rule 文件,但多为“按目录条件生效”,避免全局死规则拖累
    • 工具调用:接入 MCP(函数调用通用协议),并建设内部 MCP 服务 Toolshed,提供 400+ 工具(文档、工单、构建状态、Sourcegraph 搜索等)
    • 反馈与质量闸门:
    • 首先跑本地启发式 lint/检查(通常 <5 秒)
    • 再跑选择性的 CI(Stripe 有 300 万+ 测试),部分失败可自动修复
    • 为控制成本与等待时间:最多两轮 CI,强调“能本地提前发现就不要拖到 CI”

    接下来

    这篇是系列 Part 1,主要讲“怎么用、能做什么”;Part 2 会深入实现细节。整体信号很明确:当“开发者注意力”成为稀缺资源时,无人值守、可并行的编码代理正在改变工程协作方式。

    原文链接:https://stripe.dev/blog/minions-stripes-one-shot-end-to-end-coding-agents

    #AI工程化 #编码代理 #开发者效率 #CI实践 #Stripe Minions: Stripe’s one-shot, end-to-end coding agents

  18. VM0:用自然语言搭建 AI Agent,并在云端 24/7 运行VM0 主打的是「面向 AI Agent 的基础设施」,让你用自然语言定义工作流、在云端沙盒环境里持续运行,并且能完整观测每次执行过程

    VM0:用自然语言搭建 AI Agent,并在云端 24/7 运行

    VM0 主打的是「面向 AI Agent 的基础设施」,让你用自然语言定义工作流、在云端沙盒环境里持续运行,并且能完整观测每次执行过程。

    它能做什么

    一键运行 Agent:支持按需执行或定时调度,适合做日报、监控、内容汇总等自动化任务。
    自然语言构建工作流:在 Claude Code 里描述目标,协作编辑 AGENTS.md,快速拼出可执行的 Agent 指令与流程。
    云端隔离沙盒:本地开发、云端运行,环境隔离,适合让 Agent 长时间稳定跑任务。
    全链路可观测:实时日志、产物输出、执行回放(checkpoint),便于排查与迭代。

    示例场景(官网展示)

    HackerNews 摘要 Agent:自动读 Top 文章,筛选 AI 相关内容并生成可发布的总结。
    TikTok 达人筛选 Agent:搜索与筛选创作者,输出分析报告。
    日报 Agent:聚合多源数据与 API,总结后写入 Notion。
    博客生成 Agent:结合多个 API 自动产出内容。

    快速开始(官网命令)

    npm install -g @vm0/cli && vm0 onboard

    原链接:https://www.vm0.ai/

    #AI代理 #自动化工作流 #云端沙盒 #可观测性 #开发者工具 VM0 - Your Trustworthy AI Teammate

  19. Agent Trace:为 AI 写的代码建立“可追溯”标准Agent Trace 是一个开放规范,用来记录代码中哪些部分来自 AI、哪些来自人类,并把相关的模型信息、对话链接等“出处”一并纳入版本控制工作流中

    Agent Trace:为 AI 写的代码建立“可追溯”标准

    Agent Trace 是一个开放规范,用来记录代码中哪些部分来自 AI、哪些来自人类,并把相关的模型信息、对话链接等“出处”一并纳入版本控制工作流中。它强调厂商中立,让不同工具都能读写同一套归因数据。

    核心想解决什么

    • 随着 Agent/代码助手产出越来越多代码,团队需要更清楚地知道:哪些改动是 AI 生成、用的是什么模型、对应哪次对话/会话。
    • 这不是法律意义的“所有权”或“版权”判定,而是工程层面的来源记录可审计性

    主要目标

    互操作性:任何兼容工具都能写入/读取归因记录
    细粒度:支持到**文件级、行号范围(line range)**的归因
    可扩展:允许各家在不破坏兼容的情况下增加自定义元数据
    人和 Agent 都能读懂:尽量不依赖特定 UI 才能理解

    不做什么(边界很明确)

    • 不处理代码法律归属、版权问题
    • 不追踪训练数据来源
    • 不做质量评估(不判断 AI 代码“好或坏”)
    • 不绑定任何界面或产品形态

    规范长什么样(概念速览)

    Agent Trace 的基本单位是 Trace Record(JSON 记录),典型字段包括:

    version / id / timestamp:规范版本、记录 ID、时间戳
    vcs:版本控制信息(如 git commit SHA;也支持 jj/hg/svn)
    tool:生成该记录的工具及版本
    files:文件列表;每个文件下按 conversation 分组
    conversations.url:指向产生这段代码的对话链接
    ranges:该对话贡献的行号范围(可选 content_hash 用于跨移动追踪)
    metadata:自定义扩展字段(建议用反向域名避免冲突,如 dev.cursor

    实现与落地

    • 规范本身不规定 traces 存哪:可以是本地文件、git notes、数据库等。
    • 提供了一个参考实现(含存储层、hook 集成),示范如何在文件变更时自动捕获归因信息。

    链接:https://agent-trace.dev/
    #AI编程 #代码归因 #工程规范 #可追溯性 #开发工具 Agent Trace

  20. OpenClaw 正式亮相:把 AI 助手带到你常用的聊天软件里OpenClaw 宣布品牌更名,并明确了项目定位:一个运行在你自己的机器上的开源 Agent 平台,可从你日常使用的聊天应用直接调用(WhatsApp、Telegram、Discord、Slack、Teams 等),让 AI 助手“跟着你走”

    OpenClaw 正式亮相:把 AI 助手带到你常用的聊天软件里

    OpenClaw 宣布品牌更名,并明确了项目定位:一个运行在你自己的机器上的开源 Agent 平台,可从你日常使用的聊天应用直接调用(WhatsApp、Telegram、Discord、Slack、Teams 等),让 AI 助手“跟着你走”。

    为什么改名:从 Clawd / Moltbot 到 OpenClaw

    团队经历了多次命名迭代:

    Clawd:好记但涉及商标/法务问题,被建议更换
    Moltbot:寓意“蜕壳成长”,但不够顺口
    OpenClaw:已完成商标检索、域名与迁移准备,强调两点:
    Open:开源、开放、社区驱动
    Claw:延续“龙虾”项目起源与文化

    OpenClaw 是什么:你的助手,你的规则

    核心主张很直接:Your assistant. Your machine. Your rules.
    不同于把数据放在第三方服务器上的 SaaS 助手,OpenClaw 允许你把系统跑在本地电脑、家用服务器或 VPS 上:基础设施你掌控、密钥你掌控、数据也由你掌控

    本次发布更新亮点

    随更名一起上线的更新包括:

    新渠道:新增 Twitch、Google Chat 插件
    模型支持:新增 KIMI K2.5、Xiaomi MiMo-V2-Flash
    Web Chat:支持像聊天软件一样发送图片
    安全加固:累计 34 个与安全相关的提交,并发布可机器验证的安全模型;同时提醒 prompt injection 仍是行业难题,建议参考安全最佳实践

    接下来:安全优先 + 维护体系建设

    团队表示下一阶段会继续把安全作为最高优先级,同时提升网关稳定性、体验打磨,并扩展更多模型与提供商支持。由于项目增长迅猛,也在引入更多维护者并建立流程,鼓励社区参与贡献或赞助维护工作。

    原链接:https://openclaw.ai/blog/introducing-openclaw

    #开源 #AI代理 #隐私安全 #自托管 #聊天机器人 Introducing OpenClaw - OpenClaw Blog

1px