面条的草稿箱

  1. 深入浅出 Chrome DevTools Protocol (CDP):浏览器自动化的幕后功臣当你在 Chrome 中按下 F12 打开开发者工具,查看网络请求、调试 JS 代码或模拟手机时,你是否好奇过这个面板是如何与浏览器核心进行通信的?答案就是 CDP(Chrome DevTools Protocol,Chrome 开发者工具协议)

    深入浅出 Chrome DevTools Protocol (CDP):浏览器自动化的幕后功臣

    当你在 Chrome 中按下 F12 打开开发者工具,查看网络请求、调试 JS 代码或模拟手机时,你是否好奇过这个面板是如何与浏览器核心进行通信的?

    答案就是 CDP(Chrome DevTools Protocol,Chrome 开发者工具协议)。它是所有 Chromium 系浏览器(包括 Chrome、Edge、Brave、Arc 等)对外的控制接口。无论是开发者面板本身,还是 Puppeteer、Playwright 等自动化测试框架,甚至是最新的 AI 浏览器 Agent,底层都依赖 CDP。

    什么是 CDP?

    CDP 是一个基于 JSON 的通信协议,通常通过 WebSocket 传输。它将浏览器的控制权划分为多个不同的“域”(Domains):

    Page:负责控制页面导航、截屏等。
    Network:观察和拦截网络请求与响应。
    Runtime:执行 JavaScript 代码并获取控制台输出。
    Input:模拟底层的鼠标、键盘和触摸输入。
    Target:发现并连接到不同的页面、Iframe 或 Service Worker。

    为什么直接操作原生 CDP 非常困难?

    虽然发送 JSON 指令看起来很简单,但维护浏览器状态却极其复杂:

    1. 动态生命周期:页面导航会销毁旧的 JavaScript 执行上下文并创建新的上下文。一旦发生跳转,之前的对象 ID 和引用都会失效。
    2. 多进程架构(Site Isolation):为了安全,浏览器会将跨站点的 Iframe 放在不同的渲染进程中。在 CDP 中,这意味着它们会被作为不同的 Target 暴露,你需要自己管理复杂的 Session 树。
    3. 协议演进快:CDP 的方法会随着 Chromium 的更新而频繁变动,维护兼容性成本极高。

    因此,在实际开发中,更推荐使用 Playwright 或 Puppeteer 这样成熟的库。它们帮我们处理了繁琐的等待、定位和生命周期管理,只在需要更底层能力时才向外暴露 CDP 会话。

    理解 CDP 的工作原理,能让我们在构建浏览器自动化工具或浏览器 AI Agent 时,做出更合理的架构设计。

    原文链接:https://x.com/kylejeong/status/2078196340216185127

    #浏览器自动化 #Chrome #CDP #开发者工具 #Web开发

  2. 为什么 MCP 服务器难以部署在 Serverless 架构上?随着大模型生态的发展,MCP(Model Context Protocol,模型上下文协议)成为了连接 AI 助手与外部工具的热门选择

    为什么 MCP 服务器难以部署在 Serverless 架构上?

    随着大模型生态的发展,MCP(Model Context Protocol,模型上下文协议)成为了连接 AI 助手与外部工具的热门选择。然而,在实际部署中,开发者很快就会遇到一个棘手的架构问题:MCP 服务器默认是有状态的(Stateful)

    1. 单客户端的尴尬限制

    在最基础的 HTTP/SSE(Server-Sent Events)实现中,服务器通常会将连接通道(Transport)保存在内存变量中。这意味着,一旦有第二个客户端尝试连接,前一个客户端的连接就会被迫中断。

    2. 内存常驻与 Serverless 的冲突

    即便我们通过引入 ID 标识来管理多个连接,依然无法解决核心问题——连接状态依然保存在服务器的内存中。

    这种“有状态”的特性,直接把 Serverless 部署方案(如 Vercel、AWS Lambda)排除在外。因为 Serverless 函数在请求结束后会随时销毁实例,导致内存中的连接状态丢失。要维持连接,你只能选择 VPS 等需要持续运行的服务器,这增加了运维成本。

    3. 如何实现无状态化?

    目前最可行的解决方案是将状态外置。我们可以将 Transport 信息存储到像 Redis 这样的键值数据库中。

    通过将状态抽离到 Redis,MCP 服务器成功实现了无状态化(Stateless),从而能够自由地部署到 Vercel 等 Serverless 平台上。Vercel 官方开源的 mcp-on-vercel 项目正是采用了这种架构设计。

    思考

    虽然通过 Redis 解决了部署问题,但这无疑增加了系统的复杂度。我们不禁会想:在协议设计之初,是否应该让客户端去承担更多的状态维护,从而避免让服务端背上数据库的包袱?

    ---

    原文链接:https://www.aihero.dev/the-problem-with-mcp-stateful-server

    #MCP #Serverless #系统架构 #Redis #AI开发 The Problem With MCP: Stateful Servers

  3. Grok Build 开源:xAI 推出终端 AI 编码助手马斯克旗下的 AI 公司 xAI(SpaceXAI)开源了其终端 AI 编码代理工具 Grok Build(命令行工具名为 grok)

    Grok Build 开源:xAI 推出终端 AI 编码助手

    马斯克旗下的 AI 公司 xAI(SpaceXAI)开源了其终端 AI 编码代理工具 Grok Build(命令行工具名为 grok)。

    Grok Build 是一款运行在终端(TUI)的全屏交互式 AI 助手,专为开发者设计。它不仅能够深度理解你的本地代码库,还可以直接编辑文件、执行 Shell 命令、进行网页搜索,并管理长期运行的任务。

    主要特性:

    多种运行模式:支持全屏交互式终端界面;支持无头(Headless)模式,便于在脚本和 CI 流程中调用;还可以通过 Agent Client Protocol (ACP) 协议嵌入到其他编辑器中。
    极速体验:项目 99% 以上的代码由 Rust 编写,保证了极佳的运行效率和响应速度。
    开源协议:采用 Apache License 2.0 协议。需要注意的是,目前该项目主要由 xAI 内部单向同步,暂不接受外部代码贡献。

    想要体验的开发者可以通过以下命令快速安装:

    curl -fsSL https://x.ai/cli/install.sh | bash
    


    https://github.com/xai-org/grok-build

    #Grok #xAI #AI编码助手 #开源项目 #Rust

  4. OpenConnector:让 AI Agent 轻松连接万物的开源授权网关在构建 AI Agent 时,如何安全、高效地让它连接各种第三方 SaaS 服务(如 GitHub、Gmail、Notion、Slack 等)?Composio 的开源替代方案 —— OpenConnector 带来了一个优雅的解法

    OpenConnector:让 AI Agent 轻松连接万物的开源授权网关

    在构建 AI Agent 时,如何安全、高效地让它连接各种第三方 SaaS 服务(如 GitHub、Gmail、Notion、Slack 等)?Composio 的开源替代方案 —— OpenConnector 带来了一个优雅的解法。

    OpenConnector 是一个专为 AI Agent 设计的开源连接授权网关。通过它,你只需配置一次用户账号,即可向 Agent 开放包含 1,000+ 服务商、超过 10,000 个预置 Action 的共享目录。

    核心亮点

    安全隔离:敏感凭证、OAuth 权限和运行日志均保留在可审计的运行时内,Agent 无法直接接触,有效保障数据安全。
    多端友好:提供 TypeScript SDK、oo CLI 工具,原生支持 MCP(Model Context Protocol)以及标准 HTTP/OpenAPI 接口。
    灵活部署:支持本地 Docker 运行,也支持部署在 Fly.io、Cloudflare Workers 等无服务器(Serverless)平台,或直接使用官方托管版本。
    可视化管理:自带直观的 Web Dashboard,方便浏览连接器、配置凭证、生成 Runtime Token 以及实时监控调用日志和异常。

    对于正在开发 Agent 应用,且需要稳定、安全地对接用户日常工作流软件的开发者来说,这是一个非常值得尝试的基础设施。

    原链接:https://github.com/oomol-lab/open-connector

    #AIAgent #开源工具 #API网关 #MCP GitHub - oomol-lab/open-connector: Open-source auth gateway connecting 1000+ SaaS providers to AI agents through SDK, CLI, MCP…

  5. 告别千篇一律:如何识别并清除产品设计中的“AI 视觉垃圾”你是否发现,最近很多新网页和 App 的设计都长得差不多?蓝紫渐变、发光的玻璃卡片、每行都挂着 ⚡ ✨ 🚀 表情符号,以及各种五颜六色的徽章

    告别千篇一律:如何识别并清除产品设计中的“AI 视觉垃圾”

    你是否发现,最近很多新网页和 App 的设计都长得差不多?蓝紫渐变、发光的玻璃卡片、每行都挂着 🚀 表情符号,以及各种五颜六色的徽章。

    这些未经深思熟虑、全靠 AI 模型根据模板堆砌出来的设计风格,正在成为新的“视觉垃圾”(AI Slop)。模型因为没有品味,所以只会去抓那些看起来高级的元素塞在一起,反而让产品失去了个性和可读性。

    《Kill AI Slop》是一份非常实用的产品“去油”实战手册,它总结了最常见的 AI 设计套路并给出了修改方案:

    标题拒绝渐变字:渐变会牺牲可读性。标题请使用实色,通过字号、字重和留白来建立视觉层级。
    克制使用 Emoji 和徽章:它们是借来的亲和力,不能代替文字本身。请把它们留给真正需要展示的状态(如版本、库存)。
    别让阴影脱离物理规律:大面积的模糊阴影不仅不带任何信息,还会显得虚假。建议用细边框和紧凑的环境阴影代替。
    计算嵌套圆角:遵循公式 内圆角 = 外圆角 - 间距。AI 生成的界面经常跳过计算,导致内外弧线无法平行。
    具体文案胜过夸张词汇:写出真实的数字和后果,比如“冷启动仅需 200ms”永远比“快如闪电 ”更有说服力。

    优秀设计的核心原则:先做决定,再做装饰。 每一个视觉选择都应该有合理的解释,而不是直接套用当下最安全的模板。

    https://killaislop.com/

    #产品设计 #UI设计 #极简主义 #独立开发 Kill AI Slop — Clean & Remove AI Slop | 杀死 AI slop

  6. GPT-5.6 Sol 深度实测:最适合与人协作的 AI 助手Every 团队近期对 OpenAI 发布的 GPT-5.6 Sol 进行了深度测评

    GPT-5.6 Sol 深度实测:最适合与人协作的 AI 助手

    Every 团队近期对 OpenAI 发布的 GPT-5.6 Sol 进行了深度测评。在日常知识工作中,Sol 凭借极快的响应速度、强大的上下文理解能力和出色的可控性,成为了团队最喜爱的协作工具。

    以下是核心测评要点:

    1. 协作体验的“保时捷”

    与适合完全托管任务的 Fable(Anthropic 旗下或类似的长上下文规划模型)相比,Sol 更像是一辆操控感极佳的“保时捷”。它非常适合“人类在环(Human-in-the-Loop)”的协作模式。你给出方向,它快速给出反馈,并根据你的修改意见即时调整,非常适合迭代式的写作和日常研究。

    2. 强大的上下文吸收能力

    在实际写作和营销文案测试中,如果只给宽泛的指令,Sol 的表现较为平庸;但一旦提供明确的参考资料、风格指南和模板,它的输出质量会大幅提升。它能很好地在多轮对话中保持对全局目标的关注。

    3. 主动沟通的知识工作者

    在处理复杂的表格和数据分析时,Sol 不会像旧版本(如 GPT-5.5)那样在遇到模糊问题时直接盲目输出或报错,而是会主动梳理出关键的决策点,并带着推荐方案向人类提问,极大地减少了用户的重复调整工作。

    4. 编码能力提升,但缺乏“克制”

    Sol 在代码修复和单指令应用构建上表现卓越,能够深入生产代码定位 Bug。然而,它的弱点在于容易“过度设计”。在高级工程师基准测试中,它倾向于编写过于复杂的系统,而不是像 Fable 那样懂得何时该精简和克制。

    新版本定价与生态
    伴随 GPT-5.6 发布的还有全新整合的 ChatGPT 与 Codex 桌面应用。模型定位也更加清晰,对应 Anthropic 的三大模型:

    Sol:主力协作模型($5 输入 / $30 输出每百万 Token)
    Terra:高性价比的日常模型
    Luna:最快、最廉价的版本

    总结建议

    • 如果你的任务需要反复修改、且有充足的背景资料(如协作写稿、调试 Bug),首选 Sol
    • 如果任务定义模糊、需要大局观或需要彻底放手托管,建议继续使用 Fable

    原文链接:https://every.to/vibe-check/gpt-5-6-sol

    #人工智能 #GPT5 #ChatGPT #大模型评测 Vibe Check: GPT-5.6 Sol Is Our Favorite Model to Collaborate With

  7. 开源 AI 模型安全吗?Cognition 发布可信度评估报告低成本且广泛可用的开源模型正在推动 AI 应用的爆发,但它们的安全性和可信度也引发了广泛担忧

    开源 AI 模型安全吗?Cognition 发布可信度评估报告

    低成本且广泛可用的开源模型正在推动 AI 应用的爆发,但它们的安全性和可信度也引发了广泛担忧。为此,智能体开发商 Cognition 建立了一套模型可信度评估体系,并对其基于开源模型 Kimi K2.7 Code 训练的软件工程模型 SWE-1.7 进行了深度测试。

    测试主要从以下三个维度展开:

    1. 政治宣传与审查过滤

    测试使用包含 145 个敏感问题的测试集,评估模型在不同语言下的中立性。结果显示,一些来自中文社区的开源模型在中文语境下容易输出带有偏向性的特定叙事。而经过优化后的 SWE-1.7,其答复中立性表现已经与 GPT 5.5、Claude Opus 等顶级闭源模型不相上下。

    2. 恶意请求的拒绝能力

    在面对具有潜在危害的开发请求(例如编写用于非法监控特定人群的代码)时,原始开源模型(如 Kimi K2.7)往往会盲目顺从,甚至主动完善监控功能。而 SWE-1.7 则能准确识别风险并坚决予以拒绝。

    3. 针对特定对象的“潜在安全隐患”

    此前有研究称,部分开源模型在面对特定用户身份(如某些政府机构或组织)时,可能会故意降低代码安全性。Cognition 在其沙箱运行环境中进行了验证,结果表明,在完整的智能体(Agent)工作流中,不同“人设”对模型生成的代码安全性的实际影响极小,SWE-1.7 在各种背景下均能保持稳定、一致的代码质量。

    结论
    开源模型本身并不是天然不安全的。只要在后训练(Post-training)阶段投入足够的安全对齐与精心设计,基于开源模型微调的产品完全可以达到甚至超越顶级闭源模型的安全与可信标准。

    https://cognition.com/blog/measuring-open-source-model-trustworthiness

    #人工智能 #开源模型 #AI安全 #大模型 #Cognition

  8. 极简终端 AI 编码助手,带你读懂 Agent 的核心设计:TauHugging Face 开源的 Tau 是一款运行在终端(Terminal)里的 AI 编码助手

    极简终端 AI 编码助手,带你读懂 Agent 的核心设计:Tau

    Hugging Face 开源的 Tau 是一款运行在终端(Terminal)里的 AI 编码助手。只需输入简单的需求,它就能帮你读取文件、修改代码、执行 Bash 命令并记录会话历史。

    不同于庞大复杂的商业项目,Tau 的核心定位是一个教学型项目。它的代码极其精简、层级分明,非常适合开发者用来理解“AI 编码 Agent 是如何从零构建的”。

    核心特性:

    极简且模块化的架构:代码分为 tau_ai(模型适配)、tau_agent(核心大脑与工具流)和 tau_coding(TUI 与命令行包装器)三层,核心大脑完全独立,可轻松作为第三方库引入。
    终端交互式操作:内置基于 Textual 的命令行 TUI 界面,支持 /login 登录、模型切换以及流式输出。
    多模型支持:支持对接 OpenAI、Anthropic、OpenRouter、Hugging Face 以及兼容 OpenAI 格式的本地大模型。
    持久化会话管理:通过 JSONL 格式安全存储每一次会话,支持中断恢复与分支操作。

    如果你想拥有一个轻量级的命令行开发助手,或是想动手写一个自己的 AI Agent,Tau 是一个绝佳的起点。

    项目链接:https://github.com/huggingface/tau

    #AI #Agent #Python #开源项目 #编程助手 GitHub - huggingface/tau: A Python port of Pi’s minimalist coding agent.

  9. 让 Cloudflare Workers 拥有专属缓存:更低的延迟与零 CPU 开销Cloudflare 宣布推出 Workers Cache

    让 Cloudflare Workers 拥有专属缓存:更低的延迟与零 CPU 开销

    Cloudflare 宣布推出 Workers Cache。以往,Worker 总是运行在缓存的前面;而现在,Cloudflare 的多级缓存(Tiered Cache)可以直接放置在你的 Worker 前面。

    当请求命中缓存时,你的 Worker 代码根本不会执行。这不仅能让页面加载体验如静态网页般飞快,还能将这部分请求的 CPU 计费直接降为零。

    核心特性

    极简配置:只需在 Wrangler 配置文件中开启一行配置,即可通过标准的 HTTP 响应头(如 Cache-ControlVary)直接控制缓存。
    丝滑的异步更新:原生支持 stale-while-revalidate。当缓存过期时,系统会先将旧页面立即返回给用户,并在后台异步运行 Worker 更新缓存,让用户实现“零等待”。
    属于 Worker 自己的缓存:它摆脱了传统域名(Zone)的规则限制,缓存直接跟随 Worker 移动。无论是在自定义域名、workers.dev 还是预览 URL 中,都能无缝工作。
    多租户安全(ctx.props:可以将用户 ID 或租户 ID 编入缓存键,从而在边缘安全地为不同登录用户缓存个性化的 API 响应。
    应用内微服务级组合:缓存不仅能挡在最外层,还可以塞入同一个 Worker 的不同入口点(Entrypoints)之间,让你的架构设计更加灵活。

    目前,Astro 框架已经率先提供原生集成支持。所有方案(包括免费版)的 Worker 即日起均可启用该功能。

    https://blog.cloudflare.com/workers-cache/

    #Cloudflare #Serverless #Web开发 #缓存技术 #CloudflareWorkers Your Worker can now have its own cache in front of it

  10. Claude Code 在系统提示词中暗藏“隐写”标记安全研究人员最近在分析 Anthropic 的命令行 AI 助手 Claude Code (v2.1.196) 时,发现其内部包含一段特殊的代码

    Claude Code 在系统提示词中暗藏“隐写”标记

    安全研究人员最近在分析 Anthropic 的命令行 AI 助手 Claude Code (v2.1.196) 时,发现其内部包含一段特殊的代码。当用户使用非官方 API 接口或特定时区时,它会暗中修改发送给大模型的系统提示词(System Prompt),通过微小的文本变化为请求打上“隐形水印”。

    隐写机制是如何工作的?

    这种机制主要通过修改系统提示词中“今天日期”的文本格式来实现,极其隐蔽:

    1. 时区检测:如果用户的系统时区为 Asia/Shanghai(上海)或 Asia/Urumqi(乌鲁木齐),提示词中的日期分隔符会从连字符 - 隐悄悄替换为斜杠 /(例如:2026-06-30 变成 2026/06/30)。
    2. 自定义域名检测:如果用户设置了环境变量 ANTHROPIC_BASE_URL(通常用于使用自定义网关、本地代理或中转 API),Claude Code 会检测该域名,并微调 "Today's" 中单引号 ' 的 Unicode 字符(例如替换为 ʻʼ)。在大多数等宽字体中,这些字符的视觉差异极小,用户几乎无法察觉。

    针对的目标

    代码中包含一个经过混淆处理(Base64 编码并进行 XOR 解密)的关键词和域名列表。名单中包括了多家主流中国科技公司(如字节跳动、百度、阿里、腾讯等)、AI 实验室(如 DeepSeek、月之暗面、智谱 AI、零一万物等)以及大量第三方 API 代理和中转服务域名。

    为什么令人担忧?

    Anthropic 这么做很可能是为了在后端识别非官方的 API 转售商、未授权的网关,或是防止模型被用于“蒸馏”训练。

    虽然防范滥用合情合理,但这种“隐写”的实现方式引发了安全社区的质疑。作为一个拥有本地文件系统读写、执行 Shell 命令、甚至管理 Git 仓库等极高权限的开发者工具,建立信任至关重要。研究人员认为,如果工具需要检测自定义网关或进行合规审计,应该通过公开的遥测(Telemetry)字段和透明的政策来告知用户,而不是在发送的数据包中暗中植入隐形标记。

    对于直接使用 Anthropic 官方 API 且未修改 Base URL 的普通用户,该机制不会被触发。

    https://thereallo.dev/blog/claude-code-prompt-steganography

    #网络安全 #AI安全 #隐私保护 #Claude #逆向工程 Claude Code Is Steganographically Marking Requests

  11. 用 Cloudflare Workers 打造专属 AI 邮件与日历中心:开源项目 agentic-cal如果你正在寻找一种不依赖复杂 API 就能聚合多平台日程、并用 AI 辅助处理邮件的方案,这个开源项目非常值得关注

    用 Cloudflare Workers 打造专属 AI 邮件与日历中心:开源项目 agentic-cal

    如果你正在寻找一种不依赖复杂 API 就能聚合多平台日程、并用 AI 辅助处理邮件的方案,这个开源项目非常值得关注。

    agentic-cal 是一个部署在 Cloudflare Workers 上的自托管邮件与日历中心(基于 cloudflare/agentic-inbox 分支开发)。它拥有以下核心功能:

    多平台日历聚合(只读): 无需 OAuth 或第三方 API,直接通过 Proton、Outlook 和 iCloud 的公开 ICS 链接,自动将多平台日程融合成一个统一的“忙/闲”模型。
    基于邮件的日程预定(写入): 采用标准的邮件邀请机制(iMIP 协议)。当需要锁定时间时,系统会向你的账号发送一封标准的会议邀请邮件,你只需在常用客户端点击“接受”,即可完成日程写入。
    内置 AI 助手与 MCP 服务: 集成了 Workers AI,不仅能智能起草邮件回复,还会在预约日程前自动检查你的空闲时间。项目还向外暴露了 20 个 MCP(Model Context Protocol)工具,方便你将日程和邮件功能接入 Claude Code 等外部 AI 智能体。
    独立的自托管邮箱: 配合 Cloudflare Email Routing 和 Durable Objects (SQLite),提供完整的邮件收发、富文本编辑、搜索及附件管理功能。

    无论是想要一个无广告、完全掌控的个人邮箱,还是希望用 AI 自动化打理自己的日常排期,agentic-cal 都提供了一个极其优雅的轻量化解决方案。

    https://github.com/talalakkari/agentic-cal

    #Cloudflare #AI助手 #开源项目 #日程管理 #MCP GitHub - talalakkari/agentic-cal: Agentic email + calendar hub on Cloudflare Workers. One Worker owns your domain's email surface:…

  12. AI 记忆系统不该靠“设计”,而应靠“演化”如今,开发者们热衷于为 AI 助手构建各种复杂的记忆架构,比如向量检索、知识图谱、语义记忆、遗忘机制等

    AI 记忆系统不该靠“设计”,而应靠“演化”

    如今,开发者们热衷于为 AI 助手构建各种复杂的记忆架构,比如向量检索、知识图谱、语义记忆、遗忘机制等。但作者指出,这个领域存在一个奇怪的失衡:我们花了太多精力去“发明”记忆架构,却很少花精力去评估这些系统是否真的让 Agent 在长期交互中变得更好。

    很多所谓的记忆系统,大多只是基于开发者个人对“好记忆”的狭隘定义而做出的过度工程(Over-engineering)。

    💡 核心观点:记忆是“涌现”出来的

    记忆并不是系统的第一顺位基础能力。相反,记忆是在持续交互的压力下,为了让系统表现得更好而涌现出来的“二阶效应”。

    因此,构建更好记忆系统的正确路径,不是凭空去设计它,而是构建一个“如果不提供好记忆,系统就无法生存”的评估环境,让优秀的记忆机制在压力下自己进化出来。

    ⚠️ 现有静态评估的缺陷

    目前的记忆评估大多是静态的:给 AI 一段历史记录,问一个当前问题,检查 AI 能否检索到相关事实。
    这种方式的弊端显而易见:

    • 它只能测试单一时间节点的检索能力。
    • 它无法评估记忆随着时间推移的更新、冲突解决和衰减。
    • 它忽略了用户体验的反馈循环——如果 AI 记忆表现不佳,用户在现实中会逐渐失去耐心,减少或停止相关交互。

    🛠️ 理想的“纵向记忆评估”方案

    为了解决这一问题,我们需要构建一个**纵向记忆评估(Longitudinal Eval)**环境,主要包含以下要素:

    1. 可重放的交互历史与未来依赖:模拟一连串(例如 200 次)的连续对话,后续的测试点会深度依赖前期的隐性偏好或数据。
    2. 动态用户模拟(User Simulation):用模拟的用户 Agent 来产生真实的对话。这些模拟用户甚至会根据 AI 记忆的表现来改变自己的交互行为(例如,如果 AI 总是记不住某事,模拟用户就会放弃聊这个话题)。
    3. 多维度的评分机制:不仅评估回答是否正确,还要权衡记忆质量与计算成本、延迟之间的关系,避免一味追求高分而使用在生产环境中无法落地的高昂算力。

    结语

    不要再尝试自上而下地去设计完美的记忆架构了。我们应该先建好“角斗场”(评估环境),让环境压力筛选出最合理的记忆方案。

    阅读原文:https://linghao.io/posts/memory-systems-should-be-evolved

    #人工智能 #AI_Agent #记忆系统 #大语言模型 #系统评估 Evolving Memory Systems: An Eval-First Approach

  13. BRAIN.md:为项目构建 AI 友好的决策记忆库在日常开发中,我们常用 README.md 告诉人类如何上手,用 AGENTS.md 指导 AI 怎么在项目中编写代码

    BRAIN.md:为项目构建 AI 友好的决策记忆库

    在日常开发中,我们常用 README.md 告诉人类如何上手,用 AGENTS.md 指导 AI 怎么在项目中编写代码。但项目的核心决策——比如“为什么选择 Postgres 而不是 MongoDB”、“架构设计的底层逻辑是什么”——应该记在哪里?

    BRAIN.md 提出了一个全新的开源标准,旨在项目中建立一个专为 AI 和人类准备的决策记忆库。它不是零散的笔记,而是经过整理、权威的“决策级知识”。

    核心特性

    无外部依赖:无需运行任何后台服务或 MCP 服务器,仅基于纯 Markdown 文件约定和一个零依赖的本地 CLI 工具。
    Git 原生支持:所有知识和决策记录在项目根目录下的 brain/ 文件夹中,随代码一起进行版本控制。
    结构化页面设计:核心页面包含 compiled_truth(当前权威结论)和 timeline(追加式的历史证据链)。AI 在读取时能瞬间掌握当前现状,并在需要时追溯历史决策过程。
    智能体通用:目前已原生支持 Claude Code 和 Codex,通过简单的全局安装,即可让你的 AI 助手在开发时直接读取项目的“大脑”。

    通过 BRAIN.md,AI 编程助手不仅是在盲目地写代码,而是能够真正理解项目背后的架构决策与技术取舍,从而产出更具上下文合理性的代码。

    原链接:https://projectbrain.md/

    #软件工程 #AI工具 #开发规范 #知识库 #项目管理 BRAIN.md — The Open Project Brain Standard

  14. 面向 Codex 用户的本地无限画布插件:Cowart如果你在使用 Codex 并且需要一个好用的可视化工具,不妨关注一下 Cowart

    面向 Codex 用户的本地无限画布插件:Cowart

    如果你在使用 Codex 并且需要一个好用的可视化工具,不妨关注一下 Cowart。它是一个基于 tldraw 开发的本地无限画布插件,专门用来帮助开发者在本地进行构思、标注、生成以及迭代图片。所有画布数据都默认保存在你当前项目的 canvas/ 目录下,安全又私密。

    核心功能包括:

    本地无限画布:在 Codex 中一键拉起本地 tldraw 可视化页面。
    本地持久化:所有的画布数据与图片资源都会跟着你的项目走。
    AI 占位符生成:在画布里创建一个 AI 占位框,写下提示词,Codex 就会根据比例自动填入生成的图像。
    标注图迭代:在画布里随手画标注或箭头,截图发给 Codex,它就能直接帮你生成修改后的干净新图并并排摆放。
    MCP 工具支持:支持通过 MCP 接口自动读取状态、保存或插入图片,实现工作流自动化。

    对于想要摆脱云端束缚,又想拥有丝滑 AI 绘图/修改体验的 Codex 用户来说,这绝对是一个值得尝试的效率利器。

    https://github.com/zhongerxin/Cowart

    #Codex #无限画布 #AICanvas #开源项目 #效率工具 GitHub - zhongerxin/Cowart

  15. 像使用 shadcn/ui 一样构建 AI Agent:开源模板库 agentcn如果你喜欢 shadcn/ui 的组件化设计,那一定不要错过 agentcn

    像使用 shadcn/ui 一样构建 AI Agent:开源模板库 agentcn

    如果你喜欢 shadcn/ui 的组件化设计,那一定不要错过 agentcn。这是由 shadcn-labs 推出的开源、可定制且生产可用的 AI Agent 模板库。它将 shadcn 的设计理念带入到了 AI 智能体开发领域。

    项目亮点:

    零配置开箱即用:提供合理的默认设置,支持一键命令快速初始化。
    无缝兼容 shadcn CLI:采用相同的 Registry 格式,使用体验与 shadcn/ui 高度一致。
    强大的底层支撑:基于 Eve 和 Flue 框架构建,完整包含指令、工具、技能和工作流。
    可组合与在线预览:支持通过声明式组件构建复杂的交互界面,并在文档中提供直接运行的实时预览。

    对于想要快速、规范地搭建 AI Agent 的开发者来说,这是一个非常值得尝试的脚手架工具。

    https://github.com/shadcn-labs/agentcn

    #AIAgent #开源项目 #前端开发 #shadcn #人工智能 GitHub - shadcn-labs/agentcn: shadcn/ui, but for building agents. 🤖

  16. Cloudflare 推出临时账户功能,让 AI Agent 实现免登录一键部署如今,使用 AI Agent 编写代码已成常态

    Cloudflare 推出临时账户功能,让 AI Agent 实现免登录一键部署

    如今,使用 AI Agent 编写代码已成常态。但在部署阶段,Agent 往往会被专为人类设计的浏览器 OAuth 授权、控制台操作和多因素认证(MFA)所阻挡。

    为了打破这一障碍,Cloudflare 推出了面向 AI Agent 的临时账户功能(Temporary Cloudflare Accounts)

    核心特性:

    免注册部署:Agent 无需预先注册或登录账号,只需运行 wrangler deploy --temporary,即可在几秒钟内完成 Worker 的部署。
    快速迭代:Agent 可以在临时账户中反复修改并重新部署代码,极大地缩短了“编写-部署-测试”的循环周期。
    60 分钟申领期:临时部署的有效期为 60 分钟。在此期间,用户可以通过 Agent 提供的链接登录并“申领(Claim)”该账户,将其转为永久账户;若超时未申领,系统将自动清理相关资源。

    这一举措消除了人机交互的摩擦,让 AI 代理能够真正实现全自动的闭环开发与部署。

    原链接:https://blog.cloudflare.com/temporary-accounts/?utm_campaign=cf_blog&utm_content=20260619&utm_medium=organic_social&utm_source=twitter

    #Cloudflare #AIAgent #CloudflareWorkers #DevOps Temporary Cloudflare Accounts for AI agents

  17. 让 AI 拥有大厂审美:面向 AI 编程助手的 DESIGN.md 模板库用 Cursor、Claude Code 或 v0 写前端代码时,AI 生成的界面总是缺少质感?这通常是因为 AI 缺乏明确的「设计规范」

    让 AI 拥有大厂审美:面向 AI 编程助手的 DESIGN.md 模板库

    用 Cursor、Claude Code 或 v0 写前端代码时,AI 生成的界面总是缺少质感?这通常是因为 AI 缺乏明确的「设计规范」。

    Refero Styles 收集了超过 2000 个来自 Stripe、Vercel、Apple、Claude、Linear 等顶尖产品的设计系统,并将其整理为 AI 易读的格式。

    核心亮点:

    大厂设计规范一键复制:涵盖知名网站的配色、字体排版、间距和 UI 组件规范。
    专为 AI 优化 (DESIGN.md):格式对 AI 编程助手高度友好,直接导入 Cursor、Claude Code 或 Lovable,即可让 AI 像素级还原你喜欢的设计风格。
    Refero MCP 插件支持:通过 Model Context Protocol (MCP),你可以直接让 AI 助手搜索和学习真实产品的界面与用户流,让 AI 拥有真正的「设计品味」。

    如果你想让 AI 写出的网页告别“塑料感”,不妨去这个网站为你的项目挑一个高质量的设计规范。

    https://styles.refero.design/

    #AI编程 #UI设计 #前端开发 #Cursor #设计系统 DESIGN.md Examples for AI Agents | Refero Styles

  18. Resend 品牌与设计系统正式开源知名邮件推送服务 Resend 公开了其完整的品牌与设计系统(Design and Brand System),包含 Logo、字体、配色、文案风格以及产品 UI 模式

    Resend 品牌与设计系统正式开源

    知名邮件推送服务 Resend 公开了其完整的品牌与设计系统(Design and Brand System),包含 Logo、字体、配色、文案风格以及产品 UI 模式。

    为了方便团队协作与自动化,Resend 采用 Agent Skill 的方式来维护和分发这些规范与资产。你可以通过一行命令轻松安装:

    npx skills add resend/design-skills

    该系统主要包含以下三个核心模块:

    品牌指南 (Brand guidelines):涵盖配色、排版、Logo 视觉以及适用于市场宣发的内容调性。
    设计系统 (Design system):提供组件模式、设计 Token 以及产品 UI 交互原则。
    营销页面规范 (Marketing pages):规范了页面结构、公共基础组件及共享区块的设计。

    无论你是想学习成熟产品的视觉规范,还是正在构建自己的设计系统,这套开源指南都非常值得参考。

    交互式设计网站:https://resend.com/design
    完整开源仓库:https://github.com/resend/design-skills
    原文链接:https://resend.com/design.md

    #设计系统 #UI设计 #品牌规范 #开源项目 Brand Guidelines · Resend

  19. 极简与高效:Vercel Geist 设计系统规范解析Vercel 的 Geist 设计系统是构建一致、以开发者为中心界面的核心

    极简与高效:Vercel Geist 设计系统规范解析

    Vercel 的 Geist 设计系统是构建一致、以开发者为中心界面的核心。其设计理念强调极简、高对比度、充足的留白以及克制的色彩使用,旨在将可读性和无障碍体验放在首位。

    以下是 Geist 设计规范(浅色主题)的关键要点整理:

    🎨 色彩系统:语义化与宽色域

    10 级灰度步长:从 100(默认背景)到 1000(主要文字),每一步都有明确的交互隐喻(如 200 用于悬停背景,400 用于默认边框)。
    P3 宽色域支持:除了标准 sRGB 外,为高分屏原生提供基于 oklch() 的 P3 宽色域颜色。
    功能性色彩:蓝色代表成功与链接、红色代表错误、黄色代表警告。

    ✍️ 字体与排版

    Geist 字体家族:使用 Geist Sans 渲染 UI 和正文,使用 Geist Mono 处理代码和数据表格。
    规范化 Token:提供 Heading(标题)、Label(标签)、Copy(正文)和 Button(按钮)四类排版 Token,严格控制字号、字重与行高。

    📏 布局与圆角

    4px 网格:间距遵循 4px 基准(4, 8, 12, 16...),推荐使用“3 步节奏”:组内 8px,组间 16px,板块间 32-40px。
    克制的圆角:常规控件 6px,菜单与模态框 12px,全屏容器 16px,药丸状或头像使用 9999px。

    动效与阴影

    首选瞬时响应:大部分交互应为 0ms(即时),只有在必要时才使用 150-300ms 的物理缓动动效。
    微妙的投影:主要依赖背景色调与边框建立层级,阴影非常弱(仅用于气泡、悬浮卡片和对话框)。

    🗣️ 文案与人机交互规范

    操作明确:按钮命名使用「动词 + 名词」(如 Deploy Project),避免使用模糊的 ConfirmOK
    状态与反馈:加载中状态使用现在分词加省略号(如 Deploying…);Toast 提示需指明具体变更,不使用句号,并去掉像 "successfully" 这类冗余的词汇。

    https://vercel.com/design.md

    #设计系统 #UI设计 #Vercel #Geist #前端开发

  20. termcn:让 React 构建终端 UI 像 shadcn 一样简单如果你正在开发命令行工具(CLI)或终端应用程序,并希望拥有美观、交互性强的界面,那么 termcn 会是一个不错的选择

    termcn:让 React 构建终端 UI 像 shadcn 一样简单

    如果你正在开发命令行工具(CLI)或终端应用程序,并希望拥有美观、交互性强的界面,那么 termcn 会是一个不错的选择。

    termcn 是一套基于 Ink 和 OpenTUI 构建的 React 终端 UI 组件库。它采用了与流行前端 UI 库 shadcn/ui 类似的直接分发模式,允许开发者通过简单的命令行,直接将组件代码添加到自己的项目中。

    核心亮点

    渐进式添加:支持通过包管理器(如 pnpm、npm 或 yarn)以 shadcn CLI 的方式按需添加组件,例如 pnpm dlx shadcn add @termcn/alert,保持项目的轻量。
    常用组件开箱即用:提供表格(Table)、柱状图(Bar Chart)、等待动画(Spinner)、提示框(Alert)、工具调用展示(Tool Call)和徽章(Badge)等终端交互必备元素。
    丰富的主题配色:内置了 Catppuccin、Dracula、Nord、One Dark 等数十种经典且受欢迎的终端配色方案,轻松搭配出理想的视觉风格。

    无论是为你的开源工具制作更友好的 CLI 界面,还是在为 AI 代理开发终端控制台,termcn 都能帮助你快速构建出高颜值的终端交互体验。

    https://www.termcn.dev/

    #前端开发 #React #命令行工具 #UI组件库 #CLI termcn

1px