<?xml version="1.0" encoding="UTF-8"?><?xml-stylesheet href="/rss.xsl" type="text/xsl"?><rss version="2.0" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>基准测试 | 面条的草稿箱</title><description>无原创，纯转发</description><link>https://localhost</link><item><title>CursorBench：Cursor 如何更贴近真实开发来评估模型质量开发者正在把更长、更复杂的编程任务交给智能体：跨多个文件、工具和步骤</title><link>https://localhost/posts/120</link><guid isPermaLink="true">https://localhost/posts/120</guid><pubDate>Fri, 13 Mar 2026 06:03:11 GMT</pubDate><content:encoded>&lt;b&gt;CursorBench：Cursor 如何更贴近真实开发来评估模型质量&lt;/b&gt;&lt;br /&gt;&lt;br /&gt;开发者正在把更长、更复杂的编程任务交给智能体：跨多个文件、工具和步骤。Cursor 认为，评测方式也必须随之升级，才能真实反映“好用与否”。&lt;br /&gt;&lt;br /&gt;Cursor 的做法是 &lt;b&gt;线上 + 线下&lt;/b&gt; 的混合评测闭环：&lt;br /&gt;&lt;br /&gt;•   &lt;b&gt;线下：CursorBench（内部基准）&lt;/b&gt;&lt;br /&gt;    基于工程团队的真实 Cursor 会话构建，而不是从公开代码库抽题。因为更贴近实际工作流、信息更不充分且常带歧义，CursorBench 往往能更好地区分前沿模型，并衡量多维能力（正确性、代码质量、效率、交互行为等）。&lt;br /&gt;&lt;br /&gt;•   &lt;b&gt;线上：真实流量的受控实验&lt;/b&gt;&lt;br /&gt;    用于捕捉线下评测遗漏的退化：例如线下评分器判“正确”，但开发者实际体验变差。Cursor 会用多类代理指标（交互信号 + 输出质量信号）综合观察，并通过消融实验归因（如移除语义搜索工具来定位其关键场景）。&lt;br /&gt;&lt;br /&gt;为什么不太依赖公开基准？Cursor 指出三类常见问题：&lt;br /&gt;&lt;br /&gt;1.  &lt;b&gt;任务不匹配&lt;/b&gt;：许多基准仍偏向“修 bug”或“解谜题”，与真实开发请求脱节。&lt;br /&gt;2.  &lt;b&gt;评分困难&lt;/b&gt;：真实请求常有多种正确解，固定答案容易误伤合理方案。&lt;br /&gt;3.  &lt;b&gt;数据污染&lt;/b&gt;：公开仓库题目容易进入训练数据，分数被抬高；甚至出现“记忆补丁”与测试缺陷等问题。&lt;br /&gt;&lt;br /&gt;下一步，Cursor 预计开发会更多转向“长时运行智能体”。他们也计划让 CursorBench 适配更长任务，并解决成本、可复现性、以及离线结果与真实体验之间的差距。&lt;br /&gt;&lt;br /&gt;原文链接：&lt;a href=&quot;https://cursor.com/cn/blog/cursorbench&quot; target=&quot;_blank&quot;&gt;https://cursor.com/cn/blog/cursorbench&lt;/a&gt;&lt;br /&gt;&lt;br /&gt;&lt;a href=&quot;/search/result?q=%23%E6%A8%A1%E5%9E%8B%E8%AF%84%E6%B5%8B&quot;&gt;#模型评测&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23%E7%BC%96%E7%A8%8B%E6%99%BA%E8%83%BD%E4%BD%93&quot;&gt;#编程智能体&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23%E5%9F%BA%E5%87%86%E6%B5%8B%E8%AF%95&quot;&gt;#基准测试&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23Cursor&quot;&gt;#Cursor&lt;/a&gt; &lt;a href=&quot;/search/result?q=%23%E5%BC%80%E5%8F%91%E8%80%85%E4%BD%93%E9%AA%8C&quot;&gt;#开发者体验&lt;/a&gt;&lt;a href=&quot;https://cursor.com/cn/blog/cursorbench&quot; target=&quot;_blank&quot;&gt;
  
  &lt;div&gt;Cursor&lt;/div&gt;
  &lt;img class=&quot;link_preview_image&quot; alt=&quot;How we compare model quality in Cursor · Cursor&quot; src=&quot;https://memo.miantiao.me/static/https://cdn4.telesco.pe/file/QRvICVn9snfzukg82oFNZXywk4nurNWHeEwJrrPLmFAO7IZZHlo7sEP_qI_acKG1_RPMpo7Lfm88ritWi6KP78DNBgac4qbTzAiVDEtUTR_7NEL6WmTe2O8lmNRtdhifXCW31XhvLvk8X8jHBOycBh1ztir-qVYthNrpbL1DYK4UMtpJhYHAfb4N_hH7EO3NmZQ2n_YNq9KDTRVyocV4ORVIPzFwoynkGakSxLab1gFHzk860MJ_JmRhC47fVUVijcu3bswc_P62gdWXIUfGd-WCCiZiQVLxKMZxq061REs2e5Ts1omkAiPEOMcwXWhhUsUjBB2BBMWBWn7ugDTCzA.jpg&quot; width=&quot;1200&quot; height=&quot;630&quot; loading=&quot;eager&quot; /&gt;
  &lt;div&gt;How we compare model quality in Cursor · Cursor&lt;/div&gt;
  &lt;div&gt;We use a hybrid online-offline eval process to keep our understanding of model quality aligned with what developers actually do.&lt;/div&gt;
&lt;/a&gt;</content:encoded></item></channel></rss>