AI新闻资讯智源研究院发布代码生成训练数据集 TACO12-2514.0K 阅读智源研究院发布了名为 TACO 的代码生成训练集,旨在为代码生成模型提供更具挑战性的训练数据和评测基准。TACO 在数据规模、质量和评测方案上具有优势,包括更大规模的训练集和测试集,多样化的解题答案,以及细粒度的标签。实验结果显示,当前流行的代码生成模型在 TACO 评测中与 GPT-4 存在显著差异,说明该领域仍有提升空间。TACO 不仅是一个挑战性的测试方法,还可用作改进模型性能的训练数据,促进代码生成领域的发展。标签:代码生成训练数据集评测基准相关推荐Claude Opus5展现游戏生成能力:可用代码打造射击、赛车和3D世界Claude Opus5模型展现强大的代码生成能力,开发者用同一条提示词让其直接生成射击、潜艇、赛车及沙盒等多款游戏。整个过程无需任何外部素材,模型可直接输出几何结构、纹理、物理效果与音乐,全部在浏览器中运行,颠覆传统依赖资源库的游戏开发模式。08-0315.6K月之暗面发布新模型K2.6:长程任务与智能体能力实现新突破月之暗面发布并开源Kimi K2.6模型,在代码生成与智能体领域取得突破。该模型在基础性能、长程任务处理和Agent集群协同方面表现突出,测试数据显示其在多项关键指标上竞争力强。04-2117.7KxAI 创始团队几乎“团灭”:马斯克亲率特斯拉援军接管马斯克旗下AI公司xAI正经历严重人事动荡。联合创始人马努埃尔·克罗伊斯离职后,三年前共同创办公司的11位初始核心成员仅剩一人留任。今年以来,包括吴宇怀、吉米·巴在内的多位顶尖科学家相继出走,初创团队近乎“全员撤退”,引发外界对公司内部管理与技术路线的担忧。03-2618.1KGemini 3.5 “Snow Bunny” 泄露:一键生成3000行代码,碾压GPT-5.2谷歌Gemini系列AI模型“Snow Bunny”内部泄露,该模型被描述为革命性检查点,能一次性构建完整应用,其强大功能引发业界关注。01-2937.9K深度求索计划于2月中旬发布 DeepSeek-V4,代码生成能力大幅提升深度求索计划于2月中旬推出新一代旗舰模型DeepSeek-V4,重点提升代码生成和长代码上下文处理能力。该模型在内部测试中表现已超越Claude和GPT系列,尤其在长代码提示处理方面优势明显。01-1220.1K北京版幻方重磅开源!40B 参数大模型打破 AI 界限,仅需 3090 显卡!九坤投资推出AI大模型IQuest-Coder-V1系列,具备强大代码生成与理解能力。该系列提供7B、14B和40B三种参数版本,其中40B版本在SWE-Bench Verified榜单上表现突出,以81.4%的成绩超越Claude Opus-4.5和GPT-5.2等知名模型,引发科技界关注。01-0419.0K
Claude Opus5展现游戏生成能力:可用代码打造射击、赛车和3D世界Claude Opus5模型展现强大的代码生成能力,开发者用同一条提示词让其直接生成射击、潜艇、赛车及沙盒等多款游戏。整个过程无需任何外部素材,模型可直接输出几何结构、纹理、物理效果与音乐,全部在浏览器中运行,颠覆传统依赖资源库的游戏开发模式。08-0315.6K
月之暗面发布新模型K2.6:长程任务与智能体能力实现新突破月之暗面发布并开源Kimi K2.6模型,在代码生成与智能体领域取得突破。该模型在基础性能、长程任务处理和Agent集群协同方面表现突出,测试数据显示其在多项关键指标上竞争力强。04-2117.7K
xAI 创始团队几乎“团灭”:马斯克亲率特斯拉援军接管马斯克旗下AI公司xAI正经历严重人事动荡。联合创始人马努埃尔·克罗伊斯离职后,三年前共同创办公司的11位初始核心成员仅剩一人留任。今年以来,包括吴宇怀、吉米·巴在内的多位顶尖科学家相继出走,初创团队近乎“全员撤退”,引发外界对公司内部管理与技术路线的担忧。03-2618.1K
Gemini 3.5 “Snow Bunny” 泄露:一键生成3000行代码,碾压GPT-5.2谷歌Gemini系列AI模型“Snow Bunny”内部泄露,该模型被描述为革命性检查点,能一次性构建完整应用,其强大功能引发业界关注。01-2937.9K
深度求索计划于2月中旬发布 DeepSeek-V4,代码生成能力大幅提升深度求索计划于2月中旬推出新一代旗舰模型DeepSeek-V4,重点提升代码生成和长代码上下文处理能力。该模型在内部测试中表现已超越Claude和GPT系列,尤其在长代码提示处理方面优势明显。01-1220.1K
北京版幻方重磅开源!40B 参数大模型打破 AI 界限,仅需 3090 显卡!九坤投资推出AI大模型IQuest-Coder-V1系列,具备强大代码生成与理解能力。该系列提供7B、14B和40B三种参数版本,其中40B版本在SWE-Bench Verified榜单上表现突出,以81.4%的成绩超越Claude Opus-4.5和GPT-5.2等知名模型,引发科技界关注。01-0419.0K