看完50篇 AI for DV 论文,我觉得验证工程师暂时安全,但工作已经回不去了

看完50篇 AI for DV 论文,我觉得验证工程师暂时安全,但工作已经回不去了 芯片人-晒AI笔记 · AI for DV约5200字 / 阅读约9分钟Agentic EDAAI4EDAStage ContractValidator GateEDA Tool GatewayAgent HarnessDomain PackAI-Native DesignCopilot vs AgentL1-L5 AutonomyDesign State GraphSignoff这几天我干了一件有点笨的事。我把 AI for Design Verification 这个方向从2012年的早期机器学习论文一直翻到了DVCon 2026。一共50篇。能找到公开版本的我都下载了下来。找不到的就顺着 DOI、作者主页、会议论文集继续挖。中间还踩了不少坑有些链接看着像PDF下载下来其实是个付费墙页面有些论文搜索引擎能读真正点进去却只剩一个403。折腾完以后完整论文拿到了42篇另外还有一份官方演示稿和一份作者海报。然后我开始一篇一篇看。一开始我以为这批论文大概会告诉我大模型已经可以写UVM、生成SVA、自动补coverage甚至准备把验证工程师也一起优化掉了。毕竟最近两年的标题一个比一个狠。什么自动生成Testbench什么AI Formal Verification Engineer什么Agentic Regression什么从Spec到Sign-off。看着都挺吓人。但把50篇论文连起来看完以后我反而松了一口气。AI当然不是不行。只是它开始有用的地方跟很多人想的并不一样。AI for DV 最成熟的能力下一步做什么现在AI for DV最成熟的能力不是独立完成验证。而是回答一个验证工程师每天都在回答的问题。下一步最值得做什么该跑哪批测试哪个失败跟以前见过的很像哪个coverage hole值得继续追哪个formal engine更可能收敛这条assertion缺了什么helper眼前这个log到底应该先交给谁。这些问题单独看都不性感甚至有点脏活累活。可真正在项目里待过的人都知道验证的大量时间恰恰就耗在这里。测试大家都会写难的是判断下一组最值钱的测试是什么。log也都能看麻烦的是nightly regression一觉醒来炸出几千条失败里面可能只有两个根因。coverage更折磨人。最后那零点几个百分点经常藏在一组极其别扭的约束组合里随机跑十万次都未必撞得到。这才是AI真正开始切进去的地方。从 2012 到 2026一根没怎么变的骨头这条路其实很早就开始了。2012年那篇关于机器学习自动化Coverage-Directed Test Generation的综述已经把基本结构讲得很清楚了。跑一轮仿真观察coverage再根据反馈调整下一轮激励。今天大家说的RL、LLM、Agent外壳变了很多里面那根骨头其实没怎么变。还是一个反馈闭环。只是以前模型改的是约束和参数现在的Agent开始决定调用哪个工具、读取哪份规格、生成哪条属性、什么时候停下来找人。DVCon 2020 DAC 2023把低价值重复劳动挤出去我印象很深的一篇是DVCon 2020的Machine Learning-Guided Stimulus Generation。它没有试图把UVM推翻重写而是研究test内部哪些transaction更值得跑。作者在自己的实验配置中报告把模型训练和数据处理的成本也算进去整体CPU时间仍然减少了大约70%。这个思路很工程。它沿用原来的验证体系只把低价值的重复劳动挤出去。NVIDIA在DAC 2023的一篇工作更直接。 __IMG_02_DAC2023__他们从快速功能仿真的结构覆盖数据里用无监督学习挑出更有差异的测试。论文报告在保持相近功能覆盖的条件下RTL仿真时间最高可以减少约85%。其中一个GPU单元里约4000个测试命中了全量20000个测试所覆盖点的90%。五分之一的测试覆盖了九成的点。看到这个数字我第一反应不是模型真牛。而是我们过去到底烧掉了多少重复的仿真资源。。。当然这个数字不能直接搬到另一个项目里。设计规模、coverage model、测试质量、版本阶段都不一样。无监督模型认为某个测试在结构上很特别也不代表它一定能抓到高风险bug。但这个方向是成立的。AI不一定比验证工程师更懂设计它可以比人更耐心地盯着几十万次历史回归找到那些人眼很难看出来的重复和偏差。LLM 会写 SystemVerilog不等于 LLM 会验证再往后走就到了大家更熟悉的生成式AI。这里有一个特别容易被标题带偏的地方。LLM会写SystemVerilog不等于LLM会验证。这两个能力中间隔着一条很宽的河。AutoBench、CorrectBench、LLM4DV、UVLLM、UVM²这几年的论文都在尝试生成testbench、刺激、checker或者UVM环境。数字看起来也越来越漂亮。CorrectBench在论文中报告的总pass ratio是70.13%高于前代方法的52.18%和直接生成的33.33%。MEIC在178个RTL错误组成的数据集上语法修复率和功能修复率分别报告到93%和78%。这些结果已经不能再用「大模型只是玩具」来搪塞了。它确实能干活。可越往论文细节里看越会发现起作用的并不是一次生成。是编译失败以后重写。是仿真结果不对以后继续修。是formal engine返回counterexample以后重新生成helper assertion。是coverage没有增长以后换一个约束和场景。也就是生成、执行、反馈、再生成。模型负责提出候选工具负责打脸。我觉得这句话几乎可以概括当前所有相对靠谱的AI for DV系统。比编译错误更可怕false pass工具必须负责打脸因为验证里最可怕的东西从来不是编译错误。编译错误摆在那儿谁都看得见。真正可怕的是false pass。一个testbench跑通了波形也挺漂亮coverage看着也在涨但它的scoreboard跟DUT犯了同一个错误。或者生成的assertion语法没问题却表达错了规格。更离谱一点模型为了让proof收敛顺手加了一个过强的assumption把真正的bug也一起假设没了。整个流程一片绿色。芯片回来以后再告诉你绿色是假的。所以VerifLLMBench这类工作很重要。它不再只问testbench能不能编译而是问这个testbench能不能把故意注入DUT的bug找出来。这个评价方法一下就把问题拉回了验证的原点。验证资产的价值不看它写得像不像UVM要看它能不能对错误敏感。SVA 与知识图谱喂错上下文越聪明越错同样的事情也发生在SVA生成上。从早期的自然语言转SVA到Security Assertions by LLMs再到AssertLLM、VERT、HADA和NVIDIA的AssertionForge路线越来越清楚。只把一段规格扔给模型效果很有限。真实规格里的信息太散了。接口时序在波形图里例外条件在表格脚注里信号真正的名字和层次又在RTL里。规格讲的是意图assertion却必须落到真实的状态、信号和时间关系上。AssertionForge的做法就很有意思。它把规格和RTL一起变成知识图谱再从不同分辨率提取上下文生成assertion。这个思路没有迷信模型参数而是先把需求、实现和信号路径对齐。模型再聪明喂错上下文也没用。甚至有时候模型越聪明错得越像真的。这话听着有点刺耳但我越来越觉得AI for DV最后拼的可能不是谁家的模型大而是谁家的验证知识整理得更干净。规格条目跟哪段RTL有关。这条property依赖了哪些assumption。哪个coverage hole以前追过后来为什么判定不可达。这个failure signature归过谁最终对应哪个bug修复以后跑了哪些回归。这些东西大多数公司其实都有。只不过散在PDF、Excel、Jira、回归数据库、波形、邮件、工程师脑子和一些已经没人敢动的脚本里。乱得很真实。大模型不是魔法。它面对一堆互相冲突的旧规格、失效链接和过期测试也只会把这锅知识粥煮得更像一锅知识粥。DVCon 2025 → 2026从单点工具到验证操作系统这就是我看DVCon 2025和2026时感受最强烈的变化。2025年大家还在展示一个个具体用例。NVIDIA用LLM做VIP实例化Samsung用设计元数据提前生成coverage定义AMD用随机森林做regression triageInfineon用Saarthi把formal plan、SVA、proof、counterexample和formal coverage串起来。那一年的AI很像一个个装在验证流程旁边的外挂。有的负责挑测试有的负责分log有的负责写property有的负责补coverage。到了DVCon 2026词突然变了。Spec-RAG、Knowledge Graph、GraphRAG、Memory、Multi-Agent、MCP、Agentic Sign-off、Autonomous Regression。AI已经不满足于给某个环节打辅助了它开始试图维护整个验证任务的状态。Samsung公开的三层Agentic Regression Framework把Agent分成user、block和central三层。个人层处理局部测试和日志block层维护IP状态中央层再解决跨block资源和风险。这套结构挺像真实的验证组织。一个工程师不需要知道全芯片每个角落的细节一个block owner也不应该随便改另一个block的策略真正跨模块的问题才升级到中央层。Agent开始有了组织结构。这比造一个无所不能的超级Agent靠谱多了。因为验证从来就不是一个人的独角戏。EDA 厂商 vs 芯片公司谁有什么牌回到公司这边看三大EDA厂商的路线也很有意思。Synopsys把VSO.ai、Verdi、Formal Advisor和AgentEngineer往一起串。Cadence把Verisium里的Manager、Debug、AutoTriage、CodeMiner、WaveMiner、SimAI、SmartProof放在同一套验证数据面上。Siemens则强调Questa引擎原生的MCP和受控Agent。表面上大家都在讲Agent。可它们真正有价值的资产还是下面那些跑了很多年的仿真、形式、调试和verification management引擎。模型可以换。VCS、Xcelium、Questa里的工具状态项目积累的coverage、failure、waveform和proof数据没那么容易换。芯片公司又是另一边。EDA厂商有执行引擎芯片公司有规格、历史回归、缺陷和组织经验。NVIDIA、Samsung、Micron、AMD、Infineon、Intel公开出来的路线都不一样因为它们最贵的验证瓶颈不一样。Micron在NAND和DRAM验证里更关注高维参数和序列。AMD从owner和failure signature预测这种标签清楚的场景切入。Infineon把力气放在Agentic Formal上。Samsung看起来则在搭一整套内部Verification Intelligence Platform。这里比的不是谁跟风快而是谁手里有什么数据又愿意先解决哪个最贵的问题。验证工程师会被替代吗写到这里可能有人会问验证工程师到底会不会被替代坦率地讲我不知道五年以后会怎样。但只看这50篇论文和DVCon 2025、2026的公开证据我不相信短期内会出现一个AI独立接手生产级SoC验证然后自己签字说可以tape-out。现在离这一步还很远。Saarthi的端到端形式验证框架很有启发性但作者后续也承认初代整体效能大约只有40%。很多LLM testbench论文仍然集中在规模较小、边界清楚的设计上。工业论文里的数据又大多来自单项目和私有环境跨IP、跨团队、跨设计代际的泛化证据并不够。更麻烦的是sign-off不是一道有标准答案的题。规格可能自己就矛盾。coverage model可能漏了场景。一个不可达bin到底是真不可达还是约束写错了需要架构、设计和验证一起判断。模型可以给建议但最后接受风险的人还是人。不过如果因为AI暂时不能签字就觉得验证工作不会变我觉得也有点自欺欺人。它已经在变了。过去一个强验证工程师的价值很大一部分是会写环境、会调约束、会看波形、会追coverage、会从几千条log里闻出那条不对劲的味道。这些能力以后仍然重要但还会多出一层。你能不能把自己的判断过程变成机器可以使用的规则、数据和反馈。你能不能定义什么可以自动执行什么必须审批。你能不能设计一个不会靠删测试来提高回归效率、不会靠弱化assertion来提高proof成功率、不会靠忽略corner case来制造漂亮coverage的guardrail。你能不能让AI给出的每一步都留下可重放的证据。验证工程师的工作单元可能会从「亲手完成每一个动作」慢慢变成「定义目标、设置边界、检查证据、处理异常」。有点像飞机上的自动驾驶。稳定、重复、可观测的阶段机器会接手越来越多。真正恶劣的天气、传感器冲突和超出预案的情况还是要人回来。而且人不能因为平时不碰操纵杆就把判断力也一起丢了。这才是我觉得最难的地方。DV 团队的 AI 落地路线图所以如果现在让我给一个DV团队排AI落地顺序我不会从自动生成整套UVM环境开始。我会先做regression triage和failure clustering。因为标签现成风险可控做错了也容易发现。然后做test selection和coverage recommendation但保留关键测试、随机探索和周期性全量回归。模型可以少跑测试但不能自己悄悄改掉风险定义。再往后做SVA和formal helper生成。让LLM起草让formal engine判定再加vacuity、mutation和known-bug replay。Testbench生成可以试但评价指标不能只看compile rate。得给DUT注入bug看看它到底能抓住几个。至于从Spec一路自治到Sign-off的超级Agent可以研究可以做原型。别急着把签字权给它。写这篇文章的时候我总想起验证里一个很朴素的事实。设计工程师负责把功能做出来。验证工程师负责证明世界没有按我们想当然的方式运行。AI最擅长的偏偏也是从历史里学习最可能发生什么。这两者放在一起既强大又有一点危险。因为芯片里最贵的bug往往藏在所有人都没想到、数据里也从来没有出现过的地方。所以AI for DV成熟的标志不是模型终于可以写出一万行UVM。它得在该快的时候快在不知道的时候承认不知道在风险越界之前把人叫回来。我看完50篇论文最后留下的就是这么一个有点朴素的判断。AI不会替我们证明芯片一定正确。它会逼着我们重新回答什么才算证据。而这件事一旦开始验证工作就已经回不去了。我是钱大爷。芯片是视角AI是目的地。文中涉及的部分资料4. Coverage-Directed Test Generation Automated by Machine Learning—A Review4. Machine Learning-Guided Stimulus Generation for Functional Verification4. Test Selection for RTL Coverage by Unsupervised Learning from Fast Functional Simulation4. CorrectBench4. MEIC4. AssertionForge4. VerifLLMBench4. DVCon U.S. 2025 Program4. DVCon U.S. 2026 Technical Sessions4. Saarthi for AGI4. A 3-Tiered Agentic AI Framework for Verification Regression· · ·「芯片人-晒AI笔记」