Google 发布 VeriHarness:让 AI 先检查自己的长任务成果

VeriHarness 是一套长任务验证框架:它让生成结果的同一个模型再次检查成果。多份结果有分歧时,系统会查阅任务文件和数据来核实;结果一致时,也会主动寻找可能被共同忽略的问题。之后再据此挑选、修改或重做最终成果。

研究团队在 5 个长任务基准、2 个模型上测试,VeriHarness 的结果选择分数在所比较的方法中最高。加入证据驱动的修订后,相比单次生成,Gemini 3.5 Flash 平均提高 6.2 分,Claude Opus 4.8 提高 6.4 分。团队还公开约 2.6 万条模型执行记录,供后续研究使用。

arXiv | GitHub

🌸 科技圈· 茶馆 · 投稿

via 在花🎗️科技圈 - Telegram Channel
 
 
Back to Top
Copyright © 2025 BESTAI. All rights reserved.
BEST AI API中转 - OpenAI DeepSeek Claude Gemini Grok MidJourney API 2.8折起
admin@oaibest.com