<?xml version="1.0" encoding="UTF-8"?><?xml-stylesheet href="/rss.xsl" type="text/xsl"?><rss version="2.0" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>Cursor | 面条的草稿箱</title><description>无原创，纯转发</description><link>https://localhost</link><item><title>CursorBench：Cursor 如何更贴近真实开发来评估模型质量开发者正在把更长、更复杂的编程任务交给智能体：跨多个文件、工具和步骤</title><link>https://localhost/posts/120</link><guid isPermaLink="true">https://localhost/posts/120</guid><pubDate>Fri, 13 Mar 2026 06:03:11 GMT</pubDate><content:encoded>&lt;b&gt;CursorBench：&lt;/b&gt;&lt;mark&gt;&lt;b&gt;Cursor&lt;/b&gt;&lt;/mark&gt;&lt;b&gt; 如何更贴近真实开发来评估模型质量&lt;/b&gt;&lt;br /&gt;&lt;br /&gt;开发者正在把更长、更复杂的编程任务交给智能体：跨多个文件、工具和步骤。&lt;mark&gt;Cursor&lt;/mark&gt; 认为，评测方式也必须随之升级，才能真实反映“好用与否”。&lt;br /&gt;&lt;br /&gt;&lt;mark&gt;Cursor&lt;/mark&gt; 的做法是 &lt;b&gt;线上 + 线下&lt;/b&gt; 的混合评测闭环：&lt;br /&gt;&lt;br /&gt;•   &lt;b&gt;线下：CursorBench（内部基准）&lt;/b&gt;&lt;br /&gt;    基于工程团队的真实 &lt;mark&gt;Cursor&lt;/mark&gt; 会话构建，而不是从公开代码库抽题。因为更贴近实际工作流、信息更不充分且常带歧义，CursorBench 往往能更好地区分前沿模型，并衡量多维能力（正确性、代码质量、效率、交互行为等）。&lt;br /&gt;&lt;br /&gt;•   &lt;b&gt;线上：真实流量的受控实验&lt;/b&gt;&lt;br /&gt;    用于捕捉线下评测遗漏的退化：例如线下评分器判“正确”，但开发者实际体验变差。&lt;mark&gt;Cursor&lt;/mark&gt; 会用多类代理指标（交互信号 + 输出质量信号）综合观察，并通过消融实验归因（如移除语义搜索工具来定位其关键场景）。&lt;br /&gt;&lt;br /&gt;为什么不太依赖公开基准？&lt;mark&gt;Cursor&lt;/mark&gt; 指出三类常见问题：&lt;br /&gt;&lt;br /&gt;1.  &lt;b&gt;任务不匹配&lt;/b&gt;：许多基准仍偏向“修 bug”或“解谜题”，与真实开发请求脱节。&lt;br /&gt;2.  &lt;b&gt;评分困难&lt;/b&gt;：真实请求常有多种正确解，固定答案容易误伤合理方案。&lt;br /&gt;3.  &lt;b&gt;数据污染&lt;/b&gt;：公开仓库题目容易进入训练数据，分数被抬高；甚至出现“记忆补丁”与测试缺陷等问题。&lt;br /&gt;&lt;br /&gt;下一步，&lt;mark&gt;Cursor&lt;/mark&gt; 预计开发会更多转向“长时运行智能体”。他们也计划让 CursorBench 适配更长任务，并解决成本、可复现性、以及离线结果与真实体验之间的差距。&lt;br /&gt;&lt;br /&gt;原文链接：&lt;a href=&quot;https://cursor.com/cn/blog/cursorbench&quot; target=&quot;_blank&quot;&gt;https://cursor.com/cn/blog/cursorbench&lt;/a&gt;&lt;br /&gt;&lt;br /&gt;&lt;a href=&quot;/search/result?q=%23%E6%A8%A1%E5%9E%8B%E8%AF%84%E6%B5%8B&quot;&gt;#模型评测&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23%E7%BC%96%E7%A8%8B%E6%99%BA%E8%83%BD%E4%BD%93&quot;&gt;#编程智能体&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23%E5%9F%BA%E5%87%86%E6%B5%8B%E8%AF%95&quot;&gt;#基准测试&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23Cursor&quot;&gt;#Cursor&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23%E5%BC%80%E5%8F%91%E8%80%85%E4%BD%93%E9%AA%8C&quot;&gt;#开发者体验&lt;/a&gt;&lt;a href=&quot;https://cursor.com/cn/blog/cursorbench&quot; target=&quot;_blank&quot;&gt;
  
  &lt;div&gt;Cursor&lt;/div&gt;
  &lt;img class=&quot;link_preview_image&quot; alt=&quot;How we compare model quality in Cursor · Cursor&quot; src=&quot;https://memo.miantiao.me/static/https://cdn4.telesco.pe/file/QRvICVn9snfzukg82oFNZXywk4nurNWHeEwJrrPLmFAO7IZZHlo7sEP_qI_acKG1_RPMpo7Lfm88ritWi6KP78DNBgac4qbTzAiVDEtUTR_7NEL6WmTe2O8lmNRtdhifXCW31XhvLvk8X8jHBOycBh1ztir-qVYthNrpbL1DYK4UMtpJhYHAfb4N_hH7EO3NmZQ2n_YNq9KDTRVyocV4ORVIPzFwoynkGakSxLab1gFHzk860MJ_JmRhC47fVUVijcu3bswc_P62gdWXIUfGd-WCCiZiQVLxKMZxq061REs2e5Ts1omkAiPEOMcwXWhhUsUjBB2BBMWBWn7ugDTCzA.jpg&quot; width=&quot;1200&quot; height=&quot;630&quot; loading=&quot;eager&quot; /&gt;
  &lt;div&gt;How we compare model quality in &lt;mark&gt;Cursor&lt;/mark&gt; · &lt;mark&gt;Cursor&lt;/mark&gt;&lt;/div&gt;
  &lt;div&gt;We use a hybrid online-offline eval process to keep our understanding of model quality aligned with what developers actually do.&lt;/div&gt;
&lt;/a&gt;</content:encoded></item><item><title>Coding Agents 与复杂度预算Lee Robinson（Cursor 工程师）分享了一次惊人的迁移经历：仅用 3 天时间、$260 token 费用 和数百个 AI Agent，就把 cursor.com 从 CMS 迁回纯代码和 Markdown</title><link>https://localhost/posts/71</link><guid isPermaLink="true">https://localhost/posts/71</guid><pubDate>Tue, 16 Dec 2025 15:49:48 GMT</pubDate><content:encoded>Coding Agents 与复杂度预算&lt;br /&gt;&lt;br /&gt;Lee Robinson（&lt;mark&gt;Cursor&lt;/mark&gt; 工程师）分享了一次惊人的迁移经历：仅用 &lt;b&gt;3 天时间&lt;/b&gt;、&lt;b&gt;$260 token 费用&lt;/b&gt; 和数百个 AI Agent，就把 &lt;a href=&quot;http://cursor.com/&quot; target=&quot;_blank&quot;&gt;cursor.com&lt;/a&gt; 从 CMS 迁回纯代码和 Markdown。&lt;br /&gt;&lt;br /&gt;&lt;u&gt;为什么要抛弃 CMS？&lt;/u&gt;&lt;br /&gt;&lt;br /&gt;&lt;blockquote&gt;CMS 带来的隐性复杂度超乎想象：&lt;br /&gt;• 多系统用户管理&lt;br /&gt;• 预览变更的繁琐流程&lt;br /&gt;• 国际化翻译的插件地狱&lt;br /&gt;• CDN 费用暴涨（上线后花了 $56,848）&lt;br /&gt;• 代码库的依赖和抽象膨胀&lt;br /&gt;&lt;/blockquote&gt;&lt;br /&gt;&lt;u&gt;AI 时代的关键洞察&lt;/u&gt;&lt;br /&gt;&lt;br /&gt;抽象的代价从未如此之高。当内容变成代码后：&lt;br /&gt;• Agent 可以直接 grep 和编辑&lt;br /&gt;• PR 链接无需登录即可分享预览&lt;br /&gt;• 所有变更通过 git 追踪，Agent 能自主挖掘历史&lt;br /&gt;&lt;br /&gt;&lt;u&gt;迁移成果&lt;/u&gt;&lt;br /&gt;&lt;br /&gt;• 344 次 Agent 请求&lt;br /&gt;• 67 次 commit（+43K / -322K 行代码）&lt;br /&gt;• 构建速度提升 2 倍&lt;br /&gt;• 节省数千美元 CDN 费用&lt;br /&gt;• 第二天就能在手机上通过 cloud agent 合并修复&lt;br /&gt;&lt;br /&gt;&lt;u&gt;核心观点&lt;/u&gt;&lt;br /&gt;&lt;br /&gt;&quot;过度抽象一直是代码异味，现在有了简单的解决方案：花 token 删除复杂度。&quot; 编程 Agent 正在帮助团队尝试疯狂想法、清理深埋的技术债。&lt;br /&gt;&lt;br /&gt;&lt;i&gt;&lt;b&gt;🔗&lt;/b&gt;&lt;/i&gt; &lt;a href=&quot;https://leerob.com/agents&quot; target=&quot;_blank&quot;&gt;原文链接&lt;/a&gt;&lt;br /&gt;&lt;br /&gt;&lt;a href=&quot;/search/result?q=%23CodingAgent&quot;&gt;#CodingAgent&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23AI%E7%BC%96%E7%A8%8B&quot;&gt;#AI编程&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23%E6%8A%80%E6%9C%AF%E5%80%BA%E5%8A%A1&quot;&gt;#技术债务&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23Cursor&quot;&gt;#Cursor&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23%E5%BC%80%E5%8F%91%E6%95%88%E7%8E%87&quot;&gt;#开发效率&lt;/a&gt;&lt;a href=&quot;https://leerob.com/agents&quot; target=&quot;_blank&quot;&gt;
  &lt;i&gt;&lt;/i&gt;
  &lt;div&gt;Leerob&lt;/div&gt;
  
  &lt;div&gt;Coding Agents &amp;amp; Complexity Budgets&lt;/div&gt;
  &lt;div&gt;$260 in tokens and hundreds of coding agents later.&lt;/div&gt;
&lt;/a&gt;</content:encoded></item></channel></rss>