Search: #开源模型

  1. 腾讯微信开源通用多模态向量模型 WeMM-Embedding:刷新 MMEB-v2 榜单,已在微信多业务落地腾讯微信视觉团队近日开源了通用多模态嵌入模型家族 WeMM-Embedding,论文与模型权重现已全面公开

    腾讯微信开源通用多模态向量模型 WeMM-Embedding:刷新 MMEB-v2 榜单,已在微信多业务落地

    腾讯微信视觉团队近日开源了通用多模态嵌入模型家族 WeMM-Embedding,论文与模型权重现已全面公开。

    🌟 核心亮点

    全模态统一表征:支持文本、图片、视频、视觉文档以及任意图文交错(Interleaved)混合输入,并支持灵活调整输出向量维度。
    2B/4B/9B 多尺寸覆盖
    2B 规格:表现强劲,性能已超越此前 8B 级别的开源 Baseline。
    9B 规格:在多模态检索与表征权威评测榜单 MMEB-v2 上取得 80.6 分,刷新综合 SOTA 纪录。
    两阶段训练架构:先通过大规模多模态数据完成空间对齐,再利用高质量精选数据、细粒度相关性监督与跨尺度知识迁移进行优化。
    工业级实战验证:不仅在微信内部 26 项基准测试和 14 组线上 A/B 测试中表现优异,目前已在视频号、微信公众号、朋友圈及电商搜索/推荐等核心场景规模化上线。

    ---

    🔗 相关链接

    • 论文页面:https://huggingface.co/papers/2608.24053
    • 模型集合:https://huggingface.co/collections/tencent/wemm-embedding
    • GitHub 开源地址:https://github.com/Tencent/WeMM-Embedding

    #多模态 #Embedding #腾讯 #开源模型 #微信团队 Paper page - WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report

  2. AI Agent 框架如何实现崩溃自愈?深入 Pi 的 Durable Harness v2 架构设计在构建复杂且长周期的 AI Agent 系统时,进程崩溃、外部 API 超时以及并发冲突是不可避免的挑战

    AI Agent 框架如何实现崩溃自愈?深入 Pi 的 Durable Harness v2 架构设计

    在构建复杂且长周期的 AI Agent 系统时,进程崩溃、外部 API 超时以及并发冲突是不可避免的挑战。开源 AI Agent 工具库 Pi(earendil-works/pi)发布了其核心执行引擎 AgentHarness v2 的设计规范,全面重构了 Agent 的持久化、并发与容错模型。

    ---

    核心设计亮点

    1. 确定性持久化与崩溃恢复(Durable Runs)
    预写意图(Intent-first):在执行任何副作用(LLM 请求、工具调用)之前,必须先持久化一条意图记录;执行完成后再将结果作为节点提交。
    零中间态:无论是调用中断、系统崩溃还是上下文超限,重启后都能根据日志精确定位到最近的安全边界进行恢复或重试,绝不产生不一致的脏状态。

    2. Lanes(多泳道并行架构)
    • 引入类似 Git 分支的 Lane 概念。一个会话(Session)拥有唯一的共享对话树,但可以在上面并发运行多个独立的 Lane(如 Slack 频道下的不同 Thread)。
    • 每个 Lane 拥有独立的 Leaf 指针与操作日志,保证多任务互不干扰且免受竞态冲突影响。

    3. 对 KV Cache 极度友好的追加模式(Append-Only Context)
    • 运行中所有交互和配置修改均以追加(Append)形式进入上下文,避免因中间插入导致模型端 KV Cache 失效,显著降低 Token 消耗与延迟。
    • 只有在显式触发压缩(Compaction)时才做重整。

    4. 单步驱动与确定性测试(Deterministic Stepping)
    • 支持 manual 驱动模式:Agent 的每一个网络请求、工具执行、Hook 回调和存储写入都会在虚拟门控前暂停。
    • 开发者和测试套件可以一步步单步调试,任意注入输入或模拟崩溃,彻底消除异步 Agent 系统的难以复现的隐蔽 Bug。

    5. 清晰的职责分离
    Session Tree:只负责只增的对话与事实树,不掺杂编排逻辑。
    Operation Logs:记录状态机流水,专为崩溃恢复服务。
    Hooks 与 Events 分立:Hooks 负责拦截与修改执行流,Events 负责单向、实时的 UI 状态订阅。
    多存储后端:原生适配内存、JSONL 与 SQLite,并向下兼容 v3 格式。

    ---

    对于正在探索长时间运行 Agent、多分支 Agent 或企业级容错工作流的开发者来说,Pi 的 Harness v2 提供了一套非常严谨、工业级的状态机与架构参考范式。

    完整设计文档:https://github.com/earendil-works/pi/blob/harness-v2/j4/packages/agent/docs/harness-v2.md

    #AIAgent #系统架构 #开源项目 #LLM #状态机 pi/packages/agent/docs/harness-v2.md at harness-v2/j4 · earendil-works/pi

  3. 让 AI 也能做出极简可爱的吉祥物:IP as Logo Skill为产品设计一个辨识度高、圆润可爱的 IP Logo 往往需要多次打磨

    让 AI 也能做出极简可爱的吉祥物:IP as Logo Skill

    为产品设计一个辨识度高、圆润可爱的 IP Logo 往往需要多次打磨。开源项目 ip-as-logo-skill 为具备生图能力的 AI Agent 提供了一套结构化的设计规范,帮助你一键生成可以直接商用的极简 IP 角色。

    🌟 核心亮点

    严控设计复杂度:遵循极简与微拟物(Neo-skeuomorphism)美学,主体由 4~7 个基础圆形几何构成,默认采用「2 种 IP 主色 + 1 种纯色背景」的三色搭配。
    精心调校的构图:角色默认从左下角或右下角探出并占据画面 85%~95%,避免传统居中构图的呆板感。
    标准化的生图流程:Agent 会先梳理产品背景并提供 3 种设计方向,确认后一次性生成 6 张不同构图的独立高清候选图,无需繁琐调试提示词。
    纯净的 Prompt 策略:提示词专注描述画面视觉元素,不包含 “logo/icon” 等干扰词,充分释放图像模型的生成质感。

    🛠️ 兼容性与安装

    支持 Codex、豆包、Coze、Manus、YouMind、Gemini Apps、Replit Agent 等支持图像资产输出的 Agent 环境。

    通过 Agent Skills CLI 一键安装:

    npx skills@latest add s1dashu/ip-as-logo-skill
    


    项目采用 MIT 协议开源,生成内容均可免费商用。此外,作者还提供了免费的在线图库 ipaslogo.com,无需配置即可直接下载现成素材。

    🔗 项目地址:https://github.com/s1dashu/ip-as-logo-skill

    #开源项目 #AIAgent #Logo设计 #AI生图 #设计工具

  4. 开源模型实现端到端自我提升:Ornith-1.5 正式发布Ornith 正式推出了 Ornith-1.5 模型家族,将此前的“自我脚手架(Self-Scaffolding)”机制拓展为完整的端到端自我进化闭环

    开源模型实现端到端自我提升:Ornith-1.5 正式发布

    Ornith 正式推出了 Ornith-1.5 模型家族,将此前的“自我脚手架(Self-Scaffolding)”机制拓展为完整的端到端自我进化闭环。模型不再单纯依赖人工标注数据,而是能够自主生成新任务、构建评估脚手架,并通过强化学习(GRPO)持续进行自我迭代与能力突破。

    ---

    核心技术亮点:自我驱动的学习闭环

    在每个训练周期中,Ornith-1.5 协同优化三个关键环节:

    1. 自主出题(Task Generation):根据历史解决记录,生成处于能力边界前沿、有效且具有多样性的新挑战。
    2. 构建脚手架(Scaffold Construction):自主设计解题策略、工具链和评估环境,并加入防作弊与对齐奖励机制。
    3. 策略优化(GRPO RL):通过解答方案的反馈,联合优化出题质量、脚手架有效性与模型解题策略,实现能力螺旋上升。

    ---

    三种规格模型与性能表现

    Ornith-1.5 覆盖了大中小三种参数规格,在代码生成、复杂推理与 Agent 任务上均有亮眼表现:

    Ornith-1.5-397B(旗舰 MoE)
    在 Terminal-Bench 2.1 取得 86.1 分,DeepSWE 取得 56.0 分,整体性能比肩 Claude Opus 4.8,并全面超越同体量的开源模型(如 DeepSeek-V4-Flash 与 GLM-5.2)。

    Ornith-1.5-35B(轻量 MoE,单 Token 仅激活 3B)
    在 Agent 编程和代码基准(如 SWE-Bench Verified)上大幅领先同量级对手,甚至显著超越了多款 30B 级别的稠密模型。

    Ornith-1.5-9B(端侧 Dense)
    专为边缘设备优化,提供手机端量化版本(支持 iPhone 与 Android),在紧凑体积下展现出越级打怪的推理与代码能力。

    ---

    🔗 阅读原文https://ornith.ai/ornith_1_5.html

    #人工智能 #开源大模型 #强化学习 #AI编程 Ornith-1.5: From Self-Scaffolding to Self-Improvement

  5. 通俗解读:什么是 AI 时代的「Agent Harness」?业界常用一个极简公式来定义智能体:Agent = Model + Harness

    通俗解读:什么是 AI 时代的「Agent Harness」?

    业界常用一个极简公式来定义智能体:Agent = Model + Harness

    如果把大模型(Model)比作攀登者的核心力量,那么 Harness(原意为登山安全带/挽具) 就是为你提供支撑、挂载工具并确保安全的整套装备。

    在 AI 领域,Agent Harness 是为模型提供运行环境的软件外壳。它主要承担四个核心职能:

    1. 系统提示(System Prompt):像给新员工的工作指引,规范模型在特定场景下的行为准则。
    2. 工具挂载(Tools):为模型提供搜索、写代码、发邮件等能力接口,并由模型自主判断何时调用。
    3. 自主循环(Agentic Loop):构建「理解任务 ➔ 调用工具 ➔ 评估结果 ➔ 自主修正 ➔ 交付成果」的完整工作流闭环。
    4. 模型转换层(Translation Layer):抹平不同大模型(OpenAI、Anthropic、开源模型等)的接口差异,支持灵活切换与混用。

    为什么 Harness 越来越重要?
    大模型往往掌握在少数巨头手中,但 Harness 可以开源并运行在本地。借助像 Pi、OpenClaw 这类中立的开源框架,用户能够将控制权掌握在自己手中,按需定制属于自己的 AI 工作流。

    阅读原文:https://earendil.com/posts/what-is-a-harness/

    #AI智能体 #Agent #人工智能 #开源技术 What is a Harness? | EARENDIL

  6. fx:仅 6MB 的极简原生 AI 编程 Agent不同于动辄数十兆、界面复杂的“终端 IDE”,fx 是一款用 Zig 语言编写的超轻量 AI 编程助手与 CLI 工具,专注于极致性能与易嵌入性

    fx:仅 6MB 的极简原生 AI 编程 Agent

    不同于动辄数十兆、界面复杂的“终端 IDE”,fx 是一款用 Zig 语言编写的超轻量 AI 编程助手与 CLI 工具,专注于极致性能与易嵌入性。

    核心亮点:

    极小体积与资源占用:编译二进制仅约 6.4 MB,内存占用在个位数 MB 级别,非常适合资源受限环境与沙箱密集部署。
    瞬时冷启动:冷启动时间仅需约 10 微秒,输入前无冗余 I/O 操作,完美适配脚本化与程序调用。
    纯粹的 Shell 体验:摒弃繁复的 TUI 绘制,保留原汁原味的 Unix 命令行滚动交互体验。
    高效节省 Token:精简系统提示词(System Prompt)与工具集设计,不仅显著降低 Token 消耗,还进一步优化了首字生成延迟(TTFT)。
    Wasm 与生态扩展:支持编译为 WebAssembly 直接在浏览器或沙箱运行,并支持通过 MCP、插件与技能进行灵活扩展。
    开源与模型中立:采用 Apache-2.0 协议,支持本地模型、API 网关及各大商业大模型。

    体验与文档:https://fx.sh/

    #开源项目 #AI编程 #Agent #Zig #CLI工具 fx - Tiny, open, native coding agent

  7. Cloudflare 推出 Kitesurf:专为 AI Agent 打造的轻量级浏览器传统的浏览器(如 Chromium)是为人类设计的,包含了大量 AI 并不需要的组件(如标签页、主题、平滑滚动等),这使得它们非常消耗内存和计算资源

    Cloudflare 推出 Kitesurf:专为 AI Agent 打造的轻量级浏览器

    传统的浏览器(如 Chromium)是为人类设计的,包含了大量 AI 并不需要的组件(如标签页、主题、平滑滚动等),这使得它们非常消耗内存和计算资源。为了解决这个问题,Cloudflare 团队基于其 Workers 平台构建了一款专门针对 AI 代理(Agent)的新型浏览器——Kitesurf

    核心亮点

    专为 AI 优化:抛弃了人类才需要的视觉与交互开销,专注于 Token 数量、上下文窗口、可扩展性以及成本。
    极致的资源节省:与 Chromium 相比,在执行网页截图和 HTML 提取等常见任务时,Kitesurf 的 CPU 占用减少了 3 倍以上,内存占用减少了 4 到 7 倍,大幅降低了运行成本。
    构建在边缘网络:完全运行在 Cloudflare Workers 之上,利用 Rust 编译的 Wasm 模块和 Dynamic Workers 技术,实现极高的隔离性与无状态运行。
    兼容现有工具:支持 CDP(Chrome DevTools Protocol)协议,你可以直接配合 Puppeteer、Playwright 以及各类 MCP 客户端使用。

    虽然目前 Kitesurf 的首帧渲染时间比 Chromium 稍慢(约 1.7 倍),且暂不支持 WebGL、视频播放等复杂功能,但对于高并发的网页内容提取、截图及自动化任务,它是一个极具性价比的轻量化选择。

    Kitesurf 目前已在 Browser Run 开放免费 Beta 测试,并计划在成熟后开源。

    https://blog.cloudflare.com/kitesurf/

    #Cloudflare #AIAgent #浏览器 #开发者 #技术资讯 Introducing Kitesurf: The agent-first browser that runs in V8 isolates on Cloudflare Workers

  8. anydoc:毫秒级将主流文档转换为干净 Markdown 的 Rust 利器anydoc 是由网页解析平台 Firecrawl 开源的一款极速文档转换库

    anydoc:毫秒级将主流文档转换为干净 Markdown 的 Rust 利器

    anydoc 是由网页解析平台 Firecrawl 开源的一款极速文档转换库。它完全基于 Rust 编写,旨在将 Word、PowerPoint、Excel、PDF、EPUB、RTF 及 CSV 等多种主流文档格式,统一转换为干净、规范的 GitHub 风格 Markdown(GFM)。

    核心亮点:

    极致性能:纯 Rust 编写,不依赖重量级 AI 模型或外部云服务,单次转换的中位数时间小于 5 毫秒。
    📦 多端支持:除了 Rust 原生库外,还提供了 Node.js、Python 绑定以及开箱即用的 CLI 命令行工具。
    🤖 AI Agent 友好:支持作为 Agent Skill 一键集成(例如使用 npx skills),方便 AI 智能体直接读取和理解本地文档。
    🔍 智能格式检测:通过文件头字节自动识别格式,即使文件后缀名错误也能精准转换。
    📊 基准测试领先:在与 Pandoc、Docling、MarkItDown 等工具的对比测试中,anydoc 在格式支持完整度与转换速度上表现十分抢眼。

    无论是用于构建 LLM 知识库的数据预处理,还是日常的文档清理,anydoc 都是一个非常高效的开发者工具。

    项目地址:https://github.com/firecrawl/anydoc

    #Markdown #Rust #文档转换 #开发工具 #开源项目 GitHub - firecrawl/anydoc: Convert Word, PowerPoint, Excel, OpenDocument, RTF, EPUB, CSV, and PDF to clean Markdown. Built in Rust…

  9. 开源 AI 模型安全吗?Cognition 发布可信度评估报告低成本且广泛可用的开源模型正在推动 AI 应用的爆发,但它们的安全性和可信度也引发了广泛担忧

    开源 AI 模型安全吗?Cognition 发布可信度评估报告

    低成本且广泛可用的开源模型正在推动 AI 应用的爆发,但它们的安全性和可信度也引发了广泛担忧。为此,智能体开发商 Cognition 建立了一套模型可信度评估体系,并对其基于开源模型 Kimi K2.7 Code 训练的软件工程模型 SWE-1.7 进行了深度测试。

    测试主要从以下三个维度展开:

    1. 政治宣传与审查过滤

    测试使用包含 145 个敏感问题的测试集,评估模型在不同语言下的中立性。结果显示,一些来自中文社区的开源模型在中文语境下容易输出带有偏向性的特定叙事。而经过优化后的 SWE-1.7,其答复中立性表现已经与 GPT 5.5、Claude Opus 等顶级闭源模型不相上下。

    2. 恶意请求的拒绝能力

    在面对具有潜在危害的开发请求(例如编写用于非法监控特定人群的代码)时,原始开源模型(如 Kimi K2.7)往往会盲目顺从,甚至主动完善监控功能。而 SWE-1.7 则能准确识别风险并坚决予以拒绝。

    3. 针对特定对象的“潜在安全隐患”

    此前有研究称,部分开源模型在面对特定用户身份(如某些政府机构或组织)时,可能会故意降低代码安全性。Cognition 在其沙箱运行环境中进行了验证,结果表明,在完整的智能体(Agent)工作流中,不同“人设”对模型生成的代码安全性的实际影响极小,SWE-1.7 在各种背景下均能保持稳定、一致的代码质量。

    结论
    开源模型本身并不是天然不安全的。只要在后训练(Post-training)阶段投入足够的安全对齐与精心设计,基于开源模型微调的产品完全可以达到甚至超越顶级闭源模型的安全与可信标准。

    https://cognition.com/blog/measuring-open-source-model-trustworthiness

    #人工智能 #开源模型 #AI安全 #大模型 #Cognition Measuring the Trustworthiness of Open-Source-Derived Models

  10. 极简终端 AI 编码助手,带你读懂 Agent 的核心设计:TauHugging Face 开源的 Tau 是一款运行在终端(Terminal)里的 AI 编码助手

    极简终端 AI 编码助手,带你读懂 Agent 的核心设计:Tau

    Hugging Face 开源的 Tau 是一款运行在终端(Terminal)里的 AI 编码助手。只需输入简单的需求,它就能帮你读取文件、修改代码、执行 Bash 命令并记录会话历史。

    不同于庞大复杂的商业项目,Tau 的核心定位是一个教学型项目。它的代码极其精简、层级分明,非常适合开发者用来理解“AI 编码 Agent 是如何从零构建的”。

    核心特性:

    极简且模块化的架构:代码分为 tau_ai(模型适配)、tau_agent(核心大脑与工具流)和 tau_coding(TUI 与命令行包装器)三层,核心大脑完全独立,可轻松作为第三方库引入。
    终端交互式操作:内置基于 Textual 的命令行 TUI 界面,支持 /login 登录、模型切换以及流式输出。
    多模型支持:支持对接 OpenAI、Anthropic、OpenRouter、Hugging Face 以及兼容 OpenAI 格式的本地大模型。
    持久化会话管理:通过 JSONL 格式安全存储每一次会话,支持中断恢复与分支操作。

    如果你想拥有一个轻量级的命令行开发助手,或是想动手写一个自己的 AI Agent,Tau 是一个绝佳的起点。

    项目链接:https://github.com/huggingface/tau

    #AI #Agent #Python #开源项目 #编程助手 GitHub - huggingface/tau: A Python port of Pi’s minimalist coding agent.

  11. 用 Cloudflare Workers 打造专属 AI 邮件与日历中心:开源项目 agentic-cal如果你正在寻找一种不依赖复杂 API 就能聚合多平台日程、并用 AI 辅助处理邮件的方案,这个开源项目非常值得关注

    用 Cloudflare Workers 打造专属 AI 邮件与日历中心:开源项目 agentic-cal

    如果你正在寻找一种不依赖复杂 API 就能聚合多平台日程、并用 AI 辅助处理邮件的方案,这个开源项目非常值得关注。

    agentic-cal 是一个部署在 Cloudflare Workers 上的自托管邮件与日历中心(基于 cloudflare/agentic-inbox 分支开发)。它拥有以下核心功能:

    多平台日历聚合(只读): 无需 OAuth 或第三方 API,直接通过 Proton、Outlook 和 iCloud 的公开 ICS 链接,自动将多平台日程融合成一个统一的“忙/闲”模型。
    基于邮件的日程预定(写入): 采用标准的邮件邀请机制(iMIP 协议)。当需要锁定时间时,系统会向你的账号发送一封标准的会议邀请邮件,你只需在常用客户端点击“接受”,即可完成日程写入。
    内置 AI 助手与 MCP 服务: 集成了 Workers AI,不仅能智能起草邮件回复,还会在预约日程前自动检查你的空闲时间。项目还向外暴露了 20 个 MCP(Model Context Protocol)工具,方便你将日程和邮件功能接入 Claude Code 等外部 AI 智能体。
    独立的自托管邮箱: 配合 Cloudflare Email Routing 和 Durable Objects (SQLite),提供完整的邮件收发、富文本编辑、搜索及附件管理功能。

    无论是想要一个无广告、完全掌控的个人邮箱,还是希望用 AI 自动化打理自己的日常排期,agentic-cal 都提供了一个极其优雅的轻量化解决方案。

    https://github.com/talalakkari/agentic-cal

    #Cloudflare #AI助手 #开源项目 #日程管理 #MCP GitHub - talalakkari/agentic-cal: Agentic email + calendar hub on Cloudflare Workers. One Worker owns your domain's email surface:…

  12. omp:直接集成 IDE 能力的终端 AI 编码助手oh my pi (omp) 是一个专为终端设计的开源 AI 编码智能体

    omp:直接集成 IDE 能力的终端 AI 编码助手

    oh my pi (omp) 是一个专为终端设计的开源 AI 编码智能体。它不仅是一个代码生成器,更是一个深度集成 IDE 工具的“全能型选手”,旨在为开发者提供开箱即用、无缝连接的终端开发体验。

    核心亮点:

    深度集成 IDE 工具链:内置 LSP(Language Server Protocol),AI 能够像在 IDE 中一样精准进行跨文件重命名与格式化;同时支持 DAP(Debug Adapter Protocol),可以直接启动调试器(如 lldb, dlv, debugpy)进行单步调试和堆栈排查。
    创新的 Snapcompact 图像压缩:当对话历史过长时,omp 不使用 LLM 进行文本总结,而是将历史记录渲染成极其微小的像素字体 PNG 图像,并发送给多模态模型读取。这一技术能够确保上下文细节不丢失,且仅消耗约 1/3 的 Token 成本。
    强悍的 Rust 原生引擎:核心由约 5.5 万行 Rust 代码构建,搜索、shell、AST 分析等高频操作均在进程内完成,避免频繁 fork 子进程,效率极高。
    本地化记忆与离线整理:使用本地 SQLite 矢量记忆库,并使用本地的小模型(如 Qwen-1.7B / Gemma-1B)在本地整理记忆与会话标题,数据不离设备。
    强大的协作与扩展性:支持通过 /collab 实现端到端加密的实时会话共享;兼容多种主流编辑器规则(如 Cursor, Cline, Copilot),甚至可以通过 ACP 协议直接在 Zed 编辑器中驱动终端中的同一个 omp 实例。

    原链接:https://omp.sh/

    #AI编码助手 #编程工具 #Rust #开源项目 #智能开发 omp — a coding agent with the IDE wired in

  13. Flue:构建下一代 AI Agent 的 TypeScript 架构框架Flue 提出了一个核心公式:Agent = Model + Harness

    Flue:构建下一代 AI Agent 的 TypeScript 架构框架

    Flue 提出了一个核心公式:Agent = Model + Harness。它不仅仅是一个简单的 SDK,而是一个专为构建自主 Agent 设计的“可编程治理框架”(Harness),旨在让开发者能够轻松打造像 Claude Code 或 Codex 这样具备规划、环境感知和执行能力的强力工具。

    核心特性:

    高度可编程: 使用 TypeScript 编写 Agent 逻辑,支持定义复杂的技能(Skills)、工作流和多 Session 管理。
    自带沙箱环境: 提供内置的虚拟沙箱或连接远程沙箱(如 Daytona),让 Agent 安全地执行 Bash 命令、读写文件或运行代码。
    安全与隐私: 采用精细的权限控制,确保敏感的 API Token 不会被模型或沙箱环境直接接触。
    跨平台部署: 编写一次逻辑,即可部署为 HTTP 服务,或在 CLI、GitHub Actions、Cloudflare Workers 等多种环境运行。

    与其使用通用的成品 AI 工具,Flue 鼓励开发者根据特定的产品需求、数据和工作流,构建完全属于自己的定制化 Agent。

    https://flueframework.com/

    #AI #Agent #TypeScript #开发工具 #开源项目 Flue — The Open Agent Framework

  14. Gemma 4 图解指南:Google DeepMind 开源模型家族全面解析Google DeepMind 发布了 Gemma 4 系列模型,作者 Maarten Grootendorst(刚入职 Google DeepMind)以丰富的可视化方式详细拆解了这一系列模型的架构设计

    Gemma 4 图解指南:Google DeepMind 开源模型家族全面解析

    Google DeepMind 发布了 Gemma 4 系列模型,作者 Maarten Grootendorst(刚入职 Google DeepMind)以丰富的可视化方式详细拆解了这一系列模型的架构设计。

    四款模型,覆盖多种场景

    Gemma 4 E2B — 密集模型,等效 20 亿参数,适合端侧部署
    Gemma 4 E4B — 密集模型,等效 40 亿参数,适合端侧部署
    Gemma 4 31B — 310 亿参数的密集模型
    Gemma 4 26B A4B — MoE 架构,总参数 260 亿,推理时仅激活 40 亿参数,兼顾性能与效率

    所有模型均为多模态,支持图像输入;小模型(E2B/E4B)还额外支持音频输入

    核心架构亮点

    注意力机制优化:

    • 局部注意力(滑动窗口)与全局注意力交替堆叠(5:1 或 4:1),最后一层始终为全局注意力
    • 全局注意力层采用 8 个 Query 共享 1 个 KV 头的分组查询注意力(GQA)
    K=V 技巧:全局注意力层中 Key 等于 Value,进一步压缩 KV 缓存
    p-RoPE:仅对前 25% 维度施加旋转位置编码,避免低频维度引入噪声,提升长上下文处理能力

    视觉编码器:

    • 基于 Vision Transformer(ViT),支持可变宽高比和可变分辨率
    • 通过 2D RoPE 编码 patch 的二维位置信息
    • 引入 soft token budget(70/140/280/560/1120),用户可按任务需求灵活选择分辨率

    MoE 架构(26B A4B):

    • 128 个专家中每次激活 8 个 + 1 个始终激活的共享专家(3 倍大小)
    • 虽然总参数 260 亿,推理速度接近 40 亿参数模型

    Per-Layer Embeddings(E2B/E4B):

    • 每一层都有独立的 token embedding 查找表,存储在闪存而非显存中
    • 让小模型在有限 RAM 下也能获得更强的表达能力,非常适合手机等端侧设备

    音频编码器(E2B/E4B):

    • 基于 Conformer 架构,通过梅尔频谱图提取特征并下采样为 soft token
    • 支持语音识别和翻译等任务

    🔗 https://newsletter.maartengrootendorst.com/p/a-visual-guide-to-gemma-4

    #Gemma4 #GoogleDeepMind #多模态 #MoE #开源模型 A Visual Guide to Gemma 4

  15. GitAgent:用 Git 仓库定义 AI Agent 的开放标准AI Agent 框架百花齐放,但每个框架都有自己的结构,Agent 定义无法跨平台复用

    GitAgent:用 Git 仓库定义 AI Agent 的开放标准

    AI Agent 框架百花齐放,但每个框架都有自己的结构,Agent 定义无法跨平台复用。GitAgent 提出了一种框架无关、基于 Git 的 Agent 定义标准——克隆一个仓库,就能获得一个 Agent。

    核心理念

    Git 原生:版本控制、分支管理、Diff 比较、协作能力开箱即用
    框架无关:通过适配器导出到 Claude Code、OpenAI、CrewAI、Cursor 等任意框架
    合规就绪:内置 FINRA、美联储、SEC 等金融监管合规支持
    可组合:Agent 之间可以继承、依赖和委托

    怎么用?

    一个仓库只需两个文件即可成为 Agent:

    agent.yaml:清单文件,定义名称、版本、模型、技能、工具等
    SOUL.md:身份文件,定义人格、沟通风格和价值观

    可选添加 RULES.md(硬约束)、DUTIES.md(职责分离)、skills/(技能模块)、workflows/(工作流)等目录,按需扩展。

    亮点设计

    12 种架构模式:包括人类审批(Human-in-the-Loop)、Agent 版本管理、分支部署、Agent Fork 与混用、CI/CD 集成、生命周期钩子等
    职责分离(SOD):定义角色权限和冲突矩阵,确保关键流程不被单一 Agent 端到端控制
    SkillsFlow:用 YAML 定义确定性多步工作流,支持步骤依赖和模板数据流
    11 个导出适配器:覆盖 system-prompt、Claude Code、OpenAI、CrewAI、Cursor、Lyzr 等主流平台

    快速开始

    npm install -g gitagent
    gitagent init --template standard
    gitagent validate
    gitagent export --format system-prompt
    


    项目目前已获 1.1k Star,MIT 开源协议。

    🔗 https://github.com/open-gitagent/gitagent

    #AIAgent #GitAgent #开源 #Agent标准化 #框架无关 GitHub - open-gitagent/gitagent: A universal git-native AI agent framework. Your agent lives inside a git repo — identity, rules…

  16. GitHub Agentic Workflows:用自然语言写 GitHub Actions 的“智能工作流”GitHub 开源项目 gh-aw(GitHub Agentic Workflows),主打一个思路:用自然语言 Markdown 编写“代理式(agentic)工作流”,然后直接在 GitHub Actions 里运行,让 AI 代你完成仓库中的重复性任务

    GitHub Agentic Workflows:用自然语言写 GitHub Actions 的“智能工作流”

    GitHub 开源项目 gh-aw(GitHub Agentic Workflows),主打一个思路:用自然语言 Markdown 编写“代理式(agentic)工作流”,然后直接在 GitHub Actions 里运行,让 AI 代你完成仓库中的重复性任务。

    它提供的核心价值包括:

    更低门槛的工作流编写方式:用 Markdown 描述要做什么,而不是从零写复杂的 YAML/脚本
    更强调安全的执行模型(Guardrails):默认只读权限;写入操作需要通过经过清洗的 safe-outputs;并配套多层防护(输入净化、工具白名单、编译期校验、网络隔离、供应链安全等)
    完善的文档与上手路径:官方提供 Quick Start 与完整文档,方便快速跑通示例并理解整体机制
    生态配套
    AWF(Agent Workflow Firewall):限制与记录代理的网络访问(出站控制)
    MCP Gateway:统一转发 MCP(Model Context Protocol)服务调用,便于集中管理访问

    适合关注 AI + DevOps、希望把“AI 介入仓库日常操作”做得更可控、更工程化的团队参考与尝试(同时也要保持必要的人类监督)。

    原链接:https://github.com/github/gh-aw

    #GitHubActions #AI自动化 #工作流 #安全工程 #开源项目 GitHub - github/gh-aw: GitHub Agentic Workflows

  17. Stripe「Minions」:一键生成、端到端交付的无人值守编码代理Stripe 在内部打造了一套名为 Minions 的编码代理:从接到任务到产出可评审的 PR,全程几乎无需人类介入

    Stripe「Minions」:一键生成、端到端交付的无人值守编码代理

    Stripe 在内部打造了一套名为 Minions 的编码代理:从接到任务到产出可评审的 PR,全程几乎无需人类介入。现在,Stripe 每周有超过 1000 个合并的 PR 是由 Minions 从头到尾生成的(人类负责 Review,但不写代码)。

    为什么要自研?

    在 Stripe 这种超大规模、强约束的工程环境里,“从零写个原型”和“在成熟巨型代码库里安全改动”完全不是一回事:

    • 代码库规模巨大(数亿行),栈也相对小众:大量后端是 Ruby + Sorbet,还有大量 Stripe 自研库,LLM 天然不熟
    • 业务风险极高:Stripe 的代码承载着 每年超过 1 万亿美元 的支付规模,并受金融合规与监管约束
    • 既要让代理“会写”,也要让它“按规矩写、能跑通、能过 CI”,并与既有研发流程深度结合

    工程师怎么用?

    最常见的入口是 Slack

    • 在讨论线程里 @Slack App 就能发起 Minion,它会读取整个线程与相关链接作为上下文
    • 也集成到内部系统里:文档平台、Feature Flag、工单系统等
    例如 CI 发现 flaky tests,会生成工单,直接提供按钮让 Minion 去修

    完成后,Minion 会:

    • 创建分支 → 推送 → 跑 CI → 按模板生成 PR

    如果效果不理想,人类可以补充指令让它再改;即使不完美,也常常是很好的“可用起点”。

    Minions 背后怎么运作(要点版)

    Stripe 的思路是:把“创意生成”交给 LLM,把“必须可靠执行的步骤”交给确定性工具链

    • 运行环境:在隔离的 devbox 中执行(10 秒内可启动,预热并预载代码与服务),与生产与公网隔离,便于并行
    • Agent 框架:基于 Block 的开源编码代理 goose 的 fork,并做了强定制
    • 规则与上下文:读取各类 agent rule 文件,但多为“按目录条件生效”,避免全局死规则拖累
    • 工具调用:接入 MCP(函数调用通用协议),并建设内部 MCP 服务 Toolshed,提供 400+ 工具(文档、工单、构建状态、Sourcegraph 搜索等)
    • 反馈与质量闸门:
    • 首先跑本地启发式 lint/检查(通常 <5 秒)
    • 再跑选择性的 CI(Stripe 有 300 万+ 测试),部分失败可自动修复
    • 为控制成本与等待时间:最多两轮 CI,强调“能本地提前发现就不要拖到 CI”

    接下来

    这篇是系列 Part 1,主要讲“怎么用、能做什么”;Part 2 会深入实现细节。整体信号很明确:当“开发者注意力”成为稀缺资源时,无人值守、可并行的编码代理正在改变工程协作方式。

    原文链接:https://stripe.dev/blog/minions-stripes-one-shot-end-to-end-coding-agents

    #AI工程化 #编码代理 #开发者效率 #CI实践 #Stripe Minions: Stripe’s one-shot, end-to-end coding agents

  18. Agent Trace:为 AI 写的代码建立“可追溯”标准Agent Trace 是一个开放规范,用来记录代码中哪些部分来自 AI、哪些来自人类,并把相关的模型信息、对话链接等“出处”一并纳入版本控制工作流中

    Agent Trace:为 AI 写的代码建立“可追溯”标准

    Agent Trace 是一个开放规范,用来记录代码中哪些部分来自 AI、哪些来自人类,并把相关的模型信息、对话链接等“出处”一并纳入版本控制工作流中。它强调厂商中立,让不同工具都能读写同一套归因数据。

    核心想解决什么

    • 随着 Agent/代码助手产出越来越多代码,团队需要更清楚地知道:哪些改动是 AI 生成、用的是什么模型、对应哪次对话/会话。
    • 这不是法律意义的“所有权”或“版权”判定,而是工程层面的来源记录可审计性

    主要目标

    互操作性:任何兼容工具都能写入/读取归因记录
    细粒度:支持到**文件级、行号范围(line range)**的归因
    可扩展:允许各家在不破坏兼容的情况下增加自定义元数据
    人和 Agent 都能读懂:尽量不依赖特定 UI 才能理解

    不做什么(边界很明确)

    • 不处理代码法律归属、版权问题
    • 不追踪训练数据来源
    • 不做质量评估(不判断 AI 代码“好或坏”)
    • 不绑定任何界面或产品形态

    规范长什么样(概念速览)

    Agent Trace 的基本单位是 Trace Record(JSON 记录),典型字段包括:

    version / id / timestamp:规范版本、记录 ID、时间戳
    vcs:版本控制信息(如 git commit SHA;也支持 jj/hg/svn)
    tool:生成该记录的工具及版本
    files:文件列表;每个文件下按 conversation 分组
    conversations.url:指向产生这段代码的对话链接
    ranges:该对话贡献的行号范围(可选 content_hash 用于跨移动追踪)
    metadata:自定义扩展字段(建议用反向域名避免冲突,如 dev.cursor

    实现与落地

    • 规范本身不规定 traces 存哪:可以是本地文件、git notes、数据库等。
    • 提供了一个参考实现(含存储层、hook 集成),示范如何在文件变更时自动捕获归因信息。

    链接:https://agent-trace.dev/
    #AI编程 #代码归因 #工程规范 #可追溯性 #开发工具 Agent Trace

  19. OpenClaw 正式亮相:把 AI 助手带到你常用的聊天软件里OpenClaw 宣布品牌更名,并明确了项目定位:一个运行在你自己的机器上的开源 Agent 平台,可从你日常使用的聊天应用直接调用(WhatsApp、Telegram、Discord、Slack、Teams 等),让 AI 助手“跟着你走”

    OpenClaw 正式亮相:把 AI 助手带到你常用的聊天软件里

    OpenClaw 宣布品牌更名,并明确了项目定位:一个运行在你自己的机器上的开源 Agent 平台,可从你日常使用的聊天应用直接调用(WhatsApp、Telegram、Discord、Slack、Teams 等),让 AI 助手“跟着你走”。

    为什么改名:从 Clawd / Moltbot 到 OpenClaw

    团队经历了多次命名迭代:

    Clawd:好记但涉及商标/法务问题,被建议更换
    Moltbot:寓意“蜕壳成长”,但不够顺口
    OpenClaw:已完成商标检索、域名与迁移准备,强调两点:
    Open:开源、开放、社区驱动
    Claw:延续“龙虾”项目起源与文化

    OpenClaw 是什么:你的助手,你的规则

    核心主张很直接:Your assistant. Your machine. Your rules.
    不同于把数据放在第三方服务器上的 SaaS 助手,OpenClaw 允许你把系统跑在本地电脑、家用服务器或 VPS 上:基础设施你掌控、密钥你掌控、数据也由你掌控

    本次发布更新亮点

    随更名一起上线的更新包括:

    新渠道:新增 Twitch、Google Chat 插件
    模型支持:新增 KIMI K2.5、Xiaomi MiMo-V2-Flash
    Web Chat:支持像聊天软件一样发送图片
    安全加固:累计 34 个与安全相关的提交,并发布可机器验证的安全模型;同时提醒 prompt injection 仍是行业难题,建议参考安全最佳实践

    接下来:安全优先 + 维护体系建设

    团队表示下一阶段会继续把安全作为最高优先级,同时提升网关稳定性、体验打磨,并扩展更多模型与提供商支持。由于项目增长迅猛,也在引入更多维护者并建立流程,鼓励社区参与贡献或赞助维护工作。

    原链接:https://openclaw.ai/blog/introducing-openclaw

    #开源 #AI代理 #隐私安全 #自托管 #聊天机器人 Introducing OpenClaw - OpenClaw Blog

  20. Clawdbot:运行在你自己电脑上的个人 AI 助手Clawdbot 主打“AI 真的能做事”:它不是一个被托管在平台里的聊天机器人,而是运行在你的 Mac/Windows/Linux 上,能连接常用通讯工具与各类服务,把对话变成可执行的任务流

    Clawdbot:运行在你自己电脑上的个人 AI 助手

    Clawdbot 主打“AI 真的能做事”:它不是一个被托管在平台里的聊天机器人,而是运行在你的 Mac/Windows/Linux 上,能连接常用通讯工具与各类服务,把对话变成可执行的任务流。

    它能做什么

    本地运行、隐私优先:在你的设备上工作,数据默认留在你手里;可接入 Anthropic / OpenAI,也支持本地模型。
    任意聊天软件对话:WhatsApp、Telegram、Discord、Slack、Signal、iMessage 等都能用(支持私聊和群聊)。
    持久记忆:能记住你的偏好与上下文,越用越“懂你”。
    浏览器自动化:可浏览网页、填表、抓取信息。
    系统级能力:读写文件、运行命令、执行脚本(可全权限或沙箱化)。
    技能/插件机制:用社区技能扩展,也可以让它帮你写自己的技能。
    集成丰富:官方列出 50+ 集成(如 Gmail、GitHub、Obsidian、Spotify、Hue 等)。

    快速上手(官方提供的一键方式)

    • 一键安装:curl -fsSL https://clawd.bot/install.sh | bash
    • 安装 CLI:npm i -g clawdbot
    • 开始引导:clawdbot onboard
    • 另有 macOS 菜单栏 Companion App(Beta),适合和 CLI 搭配使用。

    https://clawd.bot/

    #AI助手 #开源工具 #自动化 #个人效率 #智能体 OpenClaw — Open-Source AI Assistant

1px