infoAI 日报 2026-09-102026年09月10日157134论文 75 / 官方 16 / 英文媒体 38 / 中文媒体 28本页聚合 AI 前沿信息:arXiv 论文、OpenAI/DeepMind/Meta/HuggingFace 官方博客、国内外 AI 媒体,均为最近 7 天内发布,附中文摘要与重要度评级。Get ready for the game with new football features in SearchGoogle AI Blog2026-09-09T16:00:00Zhttps://blog.google/products-and-platforms/products/search/football-features-google-search/Google 搜索推出新美式足球功能,结合 AI 模式提供实时比赛信息、战术分析和互动体验。该功能旨在提升用户观赛和查询效率,覆盖赛程、比分及球员数据,标志着搜索在垂直领域应用的深化。Recreating a 70-year love story frame by frameGoogle AI Blog2026-09-09T16:00:00Zhttps://blog.google/innovation-and-ai/technology/ai/love-rendered-film/Google AI 通过逐帧重建技术,将一对夫妇70年的爱情故事转化为电影画面,并在 Telluride 电影节展示。该项目利用生成式 AI 修复和增强历史影像,凸显 AI 在情感叙事和文化遗产保护中的潜力。Superintelligence is coming. Should we let it?TechCrunch AI2026-09-09T16:05:35Zhttps://techcrunch.com/video/superintelligence-is-coming-should-we-let-it/文章探讨超级智能 AI 的必然性与风险,引用 OpenAI 的 Hugging Face 安全漏洞等事件,质疑人类能否可靠控制超越自身能力的系统。播客中 Connor Leahy 等专家呼吁谨慎部署,强调安全对齐和监管的紧迫性。Microsoft has new AI privacy rules for schoolsThe Verge AI2026-09-09T17:07:48Zhttps://www.theverge.com/policy/992359/microsoft-aft-schools-ai-privacy微软与美国教师联合会达成新协议,为学校AI应用制定安全隐私原则,此前两大校区刚宣布禁止学生使用AI。该协议旨在平衡教育创新与数据保护,影响美国教育科技政策走向。Paul Christiano joins OpenAI Foundation BoardOpenAI Blog2026-09-09T17:00:00Zhttps://openai.com/index/paul-christiano-joins-openai-foundation-boardOpenAI 宣布 Paul Christiano 加入其基金会董事会及安全与安保委员会,他拥有丰富的 AI 对齐、安全和标准制定经验。此举旨在强化 OpenAI 在 AI 安全治理方面的领导力,并可能影响未来模型的安全策略。Apple CEO John Ternus says the best AI device is still the iPhoneTechCrunch AI2026-09-09T17:36:05Zhttps://techcrunch.com/2026/09/09/apple-ceo-john-ternus-says-the-best-ai-device-is-still-the-iphone/苹果高管 John Ternus 表示 iPhone 仍是最佳 AI 设备,强调其端侧模型能为用户提供更强隐私保护。这一表态凸显苹果在 AI 竞争中坚持隐私优先的差异化策略,并可能影响其 AI 产品生态布局。Apple’s revamped Health app will calculate your ‘health age’ and readiness scoreTechCrunch AI2026-09-09T18:16:29Zhttps://techcrunch.com/2026/09/09/apples-revamped-health-app-will-calculate-your-health-age-and-readiness-score/苹果更新健康应用,利用Apple Intelligence计算‘健康年龄’和准备度评分,以更智能地解读用户健康数据。该功能旨在提供个性化健康洞察,帮助用户了解自身状态。Apple has a new way prove your iPhone photos aren’t AI slopTechCrunch AI2026-09-09T18:08:35Zhttps://techcrunch.com/2026/09/09/apple-has-a-new-way-prove-your-iphone-photos-arent-ai-slop/苹果推出Apple Reference Image功能,帮助用户验证照片是否被编辑过,包括AI修改。此工具旨在应对AI生成内容泛滥,增强照片真实性和可信度。I Let an AI Agent Hack All My Gadgets—and I’d Do It AgainWired AI2026-09-09T18:30:00Zhttps://www.wired.com/story/i-used-ai-to-hack-my-home-network/本文作者移除开源模型的安全限制后,AI代理成功入侵其家用设备和个人电脑,发现多处漏洞。但该代理同时提供了修复建议,作者认为此举值得,凸显了AI在安全测试中的双刃剑作用。The hinge for Apple’s new foldable phone was built with AITechCrunch AI2026-09-09T19:21:48Zhttps://techcrunch.com/2026/09/09/the-hinge-for-apples-new-foldable-phone-was-built-with-ai/苹果新款折叠屏手机的铰链制造采用了AI和3D打印技术,这是其首次将AI融入硬件生产流程。该工艺可能提升铰链精度与耐用性,并缩短研发周期,标志着AI在消费电子制造中的实际应用深化。Apple’s new iPhone camera mode promises to prove your photo isn’t AIThe Verge AI2026-09-09T19:30:12Zhttps://www.theverge.com/tech/992766/apple-iphone-18-pro-reference-image苹果为iPhone 18 Pro系列推出“Reference Image”相机模式,利用新传感器“签名每个像素”以证明照片未经AI篡改。该功能旨在应对AI生成内容泛滥,增强数字图像可信度,将于本月晚些时候上线。Anthropic built an economic model that frames its CEO's bleakest job forecasts as an outlier scenarioThe Decoder2026-09-09T19:39:27Zhttps://the-decoder.com/anthropic-built-an-economic-model-that-frames-its-ceos-bleakest-job-forecasts-as-an-outlier-scenario/Anthropic构建经济模型预测美国至2030年经济走势,包含三种情景,极端情景下产出每4.5年翻倍且知识工作者失业率达17.9%。CEO Dario Amodei此前的悲观预测被归入最极端情景,引发对AI就业影响的讨论。苹果第一台折叠 iPhone,15999 元起极客公园2026-09-09T19:43:09Zhttp://www.geekpark.net/news/370088苹果发布首款折叠屏手机iPhone Duo,国行15999元起,10月23日发售,采用书本式内折设计,外屏5.36英寸、内屏7.58英寸,配备A20 Pro芯片和双4800万像素摄像头。与小米18 Fold相比,屏幕尺寸相近但价格高出5000元,凸显苹果高端定位。Apple Watch’s new AI features are normalizing the idea that technology is always listeningTechCrunch AI2026-09-09T20:24:48Zhttps://techcrunch.com/2026/09/09/apple-watchs-new-ai-features-are-normalizing-the-idea-that-technology-is-always-listening/苹果新款手表引入AI功能,可转录近期语音并总结环境对话,虽承诺不保存原始音频,但引发关于隐私和同意的讨论。这些功能可能改变用户行为,因为人们意识到设备可能随时记录,凸显了AI监听常态化的趋势。Everything Apple announced at its fall iPhone event, from the foldable iPhone Duo to an always-listening Apple WatchTechCrunch AI2026-09-09T20:03:43Zhttps://techcrunch.com/2026/09/09/everything-apple-announced-at-its-fall-iphone-event-from-the-foldable-iphone-duo-to-an-always-listening-apple-watch/苹果秋季发布会重点推出首款折叠屏手机iPhone Duo,同时发布支持始终监听的Apple Watch等新品。此次发布标志着苹果在硬件创新上的重大突破,折叠屏设计可能引领市场新趋势,AI功能集成成为亮点。Read the Apple document explaining how new listening features still protect your privacyThe Verge AI2026-09-09T20:44:43Zhttps://www.theverge.com/tech/992919/apple-siri-ai-audio-intelligence-privacy苹果在iPhone Duo发布会上推出多项Siri AI音频功能,并发布文档说明隐私保护机制。文档强调原始音频处理将遵循隐私原则,平衡AI环境监听与用户数据安全。刚刚,苹果首款折叠屏发布!15999元起,AI参与设计量子位2026-09-09T19:24:22Zhttps://www.qbitai.com/2026/09/486450.html苹果发布首款折叠屏手机,起售价15999元,设计过程中引入AI参与。该产品采用1:√2比例的小胖折叠形态,标志着苹果正式进入折叠屏市场。OpenAI’s sly mathematical breakthrough sends a chill through academiaThe Verge AI2026-09-09T21:16:34Zhttps://www.theverge.com/ai-artificial-intelligence/992953/openai-math-millennium-prize-navier-stokesOpenAI宣布解决了数学界千禧年大奖难题之一,这一成就展示了AI变革数学的惊人速度,但也因非正式提前泄露而蒙上阴影。该突破在学术界引发震动,凸显AI在基础科学领域的潜力与争议。San Francisco Orders Meta to Stop ‘Allowing’ AI Child Abuse AdsWired AI2026-09-09T21:15:27Zhttps://www.wired.com/story/san-francisco-orders-meta-to-stop-allowing-ai-child-abuse-ads/旧金山市检察官办公室要求Meta停止在Facebook和Instagram上允许AI生成的儿童虐待广告,并解释其反复出现的原因。Meta辩称这些广告不在该市管辖范围内,事件凸显AI内容审核与法律责任的冲突。Suno releases its first AI music model made with record industry helpThe Verge AI2026-09-09T21:42:19Zhttps://www.theverge.com/ai-artificial-intelligence/991977/suno-releases-its-first-ai-music-model-made-with-record-industry-helpSuno 发布其首个与唱片行业合作制作的 AI 音乐模型 v6,该模型从零训练,使用全新数据集,不包含旧模型数据,并包含授权内容。这标志着 AI 音乐在版权合规和行业合作上迈出重要一步。Massachusetts hits data centers with new clean power rulesTechCrunch AI2026-09-09T21:43:34Zhttps://techcrunch.com/2026/09/09/massachusetts-hits-data-centers-with-new-clean-power-rules/马萨诸塞州成为三个月内第三个对数据中心开发施加新清洁电力限制的州。此举反映美国各州对 AI 算力扩张带来的能源消耗和环境影响日益关注,可能影响数据中心选址和运营成本。OpenAI adds a prominent AI doomer to its board of directorsTechCrunch AI2026-09-09T22:25:22Zhttps://techcrunch.com/2026/09/09/openai-adds-a-prominent-ai-doomer-to-its-board-of-directors/OpenAI宣布著名AI对齐研究者Paul Christiano加入其基金会董事会,此举强化了公司在AI安全领域的治理。Christiano此前曾公开批评OpenAI的安全策略,他的加入可能推动更严格的对齐标准,并引发业界对AI风险管理的关注。The AI Researcher Who Just Quit Anthropic Says It’s ‘Crunch Time for Humanity’Wired AI2026-09-09T22:11:55Zhttps://www.wired.com/story/anthropic-researcher-quits-jacob-coxon-ai-fears-humanity/一位刚从Anthropic离职的AI研究员Jacob Coxon警告,AI安全已进入“人类关键时刻”,并透露公司内部存在类似“迷你曼哈顿计划”的紧迫项目。他认为对齐问题尚未解决,AI实验室仅有几年时间确保系统安全,否则可能面临失控风险。Google Open-Sources Mantis: A Modular Skills Toolkit That Lets Coding Agents Find, Reproduce and Patch VulnerabilitiesMarkTechPost2026-09-09T22:58:29Zhttps://www.marktechpost.com/2026/09/09/google-open-sources-mantis-a-modular-skills-toolkit-that-lets-coding-agents-find-reproduce-and-patch-vulnerabilities/Google开源了Mantis,一个面向AI编码代理的模块化安全审查技能工具包,覆盖漏洞发现、复现、修复全流程。它支持在沙箱中复现漏洞、自动打补丁并重新攻击验证,采用Apache 2.0许可,但仅作为演示用途。该工具旨在提升编码代理的安全能力,减少人工审计负担。AI research startup Listen Labs scrubbed a $1.5B funding round for Salesforce talksTechCrunch AI2026-09-10T00:00:37Zhttps://techcrunch.com/2026/09/09/ai-research-startup-listen-labs-scrubbed-a-1-5b-funding-round-for-salesforce-talks/AI 研究初创公司 Listen Labs 放弃了一轮 15 亿美元的融资,转而与 Salesforce 进行收购谈判。据消息人士称,该公司此前已与 Menlo Ventures 签署了 C 轮投资条款清单,但仍选择退出。iPhone Duo 首发上手:唯一值两万元的折叠屏爱范儿2026-09-10T00:00:28Zhttps://www.ifanr.com/1679531?utm_source=rss&utm_medium=rss&utm_campaign=爱范儿发布 iPhone Duo 折叠屏手机首发上手评测,称其为唯一值两万元的折叠屏产品,屏幕观感宛若透明,整体体验全方位超出预期。该评测聚焦高端折叠屏市场,反映出苹果在折叠形态上的产品定位与定价策略。苹果进入特努斯时代,首发 15999 元折叠屏 iPhone;Deepseek 被曝备战科创板 IPO;谷歌埃森哲组建千人 FDE 团队 | 极客早知道极客公园2026-09-10T00:58:59Zhttp://www.geekpark.net/news/370089苹果发布首款折叠屏 iPhone Duo,国行 15999 元起,采用书本式内折设计,搭载 A20 Pro 芯片,取消长焦与面容 ID 改用侧边 Touch ID。同场推出 iPhone 18 Pro 系列,标准版推迟至明年春季。此外 Deepseek 被曝备战科创板 IPO,OpenAI 企业收入反超 C 端。实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug量子位2026-09-10T00:42:06Zhttps://www.qbitai.com/2026/09/486350.html量子位实测科大讯飞星火X2.5,展示其代码生成、长文档解析与Bug排查能力,如手搓粒子月亮动画、拆解61页财报并揪出用户代码Bug。文章还提到该模型API正进行限时五折优惠,反映国产大模型在复杂任务上的实用化进展与商业化推广。LandingAI Releases Agentic Document Extraction Gen2 with DPT-3 Pro and DPT-3 VerityMarkTechPost2026-09-10T02:13:12Zhttps://www.marktechpost.com/2026/09/09/landingai-releases-agentic-document-extraction-gen2-with-dpt-3-pro-and-dpt-3-verity/LandingAI发布Agentic Document Extraction Gen2,基于DPT-3模型家族重构文档处理栈,用文档、页面、块树取代原有chunk机制。DPT-3 Pro定位到行、DPT-3 Verity定位到词并给出置信度,计费改为按输出字符数,Gen1代码不兼容Gen2端点。打造10万卡国产算力集群推出JoyAI世界模型,京东发布物理AI建设最新成果量子位2026-09-10T01:39:13Zhttps://www.qbitai.com/2026/09/486436.html京东在JDDiscovery-2026全球科技探索者大会上发布物理AI最新成果,包括打造10万卡国产算力集群并推出JoyAI世界模型。该集群规模在国内算力建设中位居前列,世界模型则瞄准物理世界建模与具身智能方向。deepwork企业 AI 工作台预览版开源中国2026-09-10T01:23:52Zhttps://www.oschina.net/news/502400deepchat升级为deepwork并发布企业AI工作台预览版,定位为能做事的智能体。该工作台集成sandbox、shell、code、MCP、skill等能力,主打企业可控的云环境与数字员工助手场景。IJPay 让支付触手可及 2.9.13 版本发布开源中国2026-09-09T16:05:20Zhttps://www.oschina.net/news/502399IJPay发布2.9.13版本,这是一款封装微信、支付宝、银联、PayPal等常用支付方式的Java支付工具库。其特点是不依赖任何第三方MVC框架,可快速嵌入任意系统完成支付模块开发。理想 i6 换上中创新航电芯,极氪 9X 光辉、Model Y 性能版现身,9 月新车提前看爱范儿2026-09-10T02:36:19Zhttps://www.ifanr.com/1679445?utm_source=rss&utm_medium=rss&utm_campaign=爱范儿汇总 9 月即将发布的新车信息,包括理想 i6 换装中创新航电芯、极氪 9X 光辉版以及 Model Y 性能版等车型。内容主要聚焦新能源汽车产品动态,与 AI 前沿技术无直接关联。Raschka 万字拆解 GPT-6 Astra:循环架构和隐藏的推理链开源中国2026-09-10T02:47:56Zhttps://www.oschina.net/news/502401/gpt-6-astra-looped-transformers-andSebastian Raschka 发布万字长文拆解 GPT-6 Astra,称其可能是自己用过最好的模型,但重点在于追查 The Information 关于 Astra 采用「循环深度」(looped transformer)架构的传闻。文章系统梳理了循环架构的技术原理与推理链机制,为理解下一代大模型架构演进提供了重要参考。OpenDiscoveryTrace: Process Traces for Evaluating AI Scientist WorkflowsarXiv AI (cs.AI)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09203OpenDiscoveryTrace 发布包含 558 条完整 AI 科学智能体轨迹的公开数据集,记录模型推理过程而非仅最终产出。每条轨迹含结构化字段,可用于审计科学方法论、诊断失败模式,并区分系统性推理与侥幸猜测,弥补现有基准只评结果的缺陷。Adaptive Entangled Game Modules in Artificial General IntelligencearXiv AI (cs.AI)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09226论文提出概率波框架建模自适应智能体的集体行为,通过广义行为智能非局域概率波方程推导可检验本征模式。研究以中国股市日内数据实证分析,并间接检验大脑非局域纠缠神经纤维的 LCA 假设,为通用人工智能提供新分析视角。Subagents vs Agent Skills: Executing Reusable Knowledge for Long-Horizon Agentic TasksarXiv AI (cs.AI)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09233论文对比子智能体与 Agent Skills 两种复用知识执行方式,指出将技能指令载入上下文的方式在长时程任务中愈发脆弱。研究探讨语言模型智能体如何有效利用可复用知识库解决长时程任务,为智能体技能组织与执行提供新思路。Gradland: On Phenomenal Experience, Differentiated Across Many DimensionsarXiv AI (cs.AI)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09306论文提出 Gradland 理想化世界,检验物理交互的一阶结构(梯度或雅可比)刻画现象体验结构的假设。研究引入基于 Kirchhoff 复杂度的有效秩与内聚度两个雅可比结构度量,通过系列示例验证该假设对体验持续时长等维度的解释力。An Autonomous GeoAI Agent for Arctic Eco-NavigationarXiv AI (cs.AI)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09374论文提出面向北极生态航行的自主 GeoAI 智能体,应对海冰变化带来的通航机遇与运营、环境及社区风险。针对现有多准则航线规划偏重时间、油耗与航行风险而忽视生态和社区影响的问题,该智能体将生态与社区因素纳入多准则决策。The Menu Is an Execution Prior: State-Path Tool Menus for Online AgentsarXiv AI (cs.AI)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09395论文提出「工具菜单」概念,即执行前展示给智能体的短小有序工具子集,并引入状态路径进行预执行规划。针对现有构造器按请求相关性排序可能遗漏前置生产工具的问题,该方法确保多步任务中最终动作及其依赖工具以可用顺序呈现。Decision-Focused Active Learning for Scale-Aware Critical-Materials RecoveryarXiv AI (cs.AI)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09413论文将决策导向主动学习应用于规模化关键材料回收流程选择,连接实验室结果与产品需求、工艺成本和规模效应。基于太平洋西北国家实验室 CICERO 自主选择性沉淀工作流数据,在 NdFeB 磁体回收记录的回溯基准中,主动学习找到了最佳记录结果。Valerant: An Automatic Navigable Game Map Generator via Action-Conditioned World Model ExplorationarXiv AI (cs.AI)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09418论文提出 Valerant,一种通过动作条件世界模型探索自动生成可导航游戏地图的方法。针对现有游戏导向方法多局限于 2D 视觉观测空间、未构建持久 3D 几何的问题,该工作将世界动作模型范式扩展到 3D 游戏环境,实现通用型游戏地图生成。XAI-Arena: Can LLMs Assess the Quality of XAI Explanations?arXiv AI (cs.AI)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09428论文提出 XAI-Arena,一个以 LLM 作为评判者的框架,用于对可解释 AI 解释质量进行可复现、可扩展、多维度和利益相关者敏感的比较评估。该工作检验 LLM 能否替代主观人工判断来评估 XAI 解释质量,以提升研究的可复现性与可比性。Do Agents Know When They Succeed? Calibrating Agent Confidence from Internal RepresentationsarXiv AI (cs.AI)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09448论文研究智能体能否从内部表征中校准对任务成功的置信度,提出潜在轨迹动力学等两种互补方法。针对智能体工作流在规划、工具调用和动态环境交互中的复杂失败模式,该工作探索模型内部表征是否比传统方法提供更强的多轮任务成功信号。ContractEval: Query-Conditioned Execution Matching for Procedural Instruction ConformancearXiv AI (cs.AI)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09458论文提出 ContractEval 诊断框架,用于评估 LLM 智能体执行程序性指令时的合规性。针对输出看似合理但实际跳过检查、分支、依赖或不变量等「无根据」失败,该框架显式表示查询所激活的义务,弥补仅看输出或轨迹的评估盲区。Multi-Agent Agentic Graph Learning via Structural SignaturesarXiv AI (cs.AI)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09565论文提出基于结构签名的多智能体智能图学习方法,应对现有智能图学习在不同图区域共享推理策略的次优问题。受程序化分治思想启发,该方法针对结构和语义模式异质的图,采用多智能体协作并依据结构签名差异化推理。CityPlanner: A Sandbox Agent for Executable Urban PlanningarXiv AI (cs.AI)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09578论文提出 CityPlanner,一个用于可执行城市规划的沙盒智能体框架,引入统一的基于文件环境 UrbanSandbox。针对现有优化与强化学习方法依赖任务特定表示和约束处理的问题,该框架让智能体在成本与服务质量等目标下从大候选空间中选择可行行动。A Function-Space Approach to the Statistical Mechanics of Learning DynamicsarXiv AI (cs.AI)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09589论文在函数空间发展学习动力学的统计力学描述,将参数配置视为微观实现、函数及其动力学算子视为宏观变量。针对均方损失,精确误差动力学由学习算子 M=JJ* 支配,结合条件随机动力学的动力学玻尔兹曼权重与参数空间密度进行分析。From State Synchronization to Cognitive Self-Evolution: An Operational Architecture for Cognitive Digital TwinsarXiv AI (cs.AI)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09625论文提出认知数字孪生的四层架构,推动数字孪生从状态同步走向任务导向和知识驱动的认知自演化。针对现有研究多聚焦学习模块、知识图谱、大模型等单项技术、缺乏系统性认知集成视角的问题,该架构给出认知能力融入数字孪生的操作化方案。X-CoSD: Communication-Efficient Cross-Vocabulary Collaborative Speculative DecodingarXiv CL (cs.CL)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09166论文提出 X-CoSD,一种跨词表的通信高效协作投机解码方法,解决端侧小模型起草、服务端大模型验证场景中的词表不共享与通信负载问题。针对残差重采样需交换 token 分布导致的高通信开销,该方法实现无损且通信高效的跨词表协作解码。StochBench: A Domain-Specific Benchmark for Stochastic Processes in LeanarXiv CL (cs.CL)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09264论文发布 StochBench,一个包含 450 道研究生级随机过程问题的 Lean 4 形式化定理证明基准,每题配有自然语言来源。该基准覆盖有限与可数马尔可夫链、更新过程、随机游走、鞅、停时、排队论和布朗运动等 Mathlib 中代表性不足的领域。Osprey: Target-agnostic Pre-training Makes Stronger Drafters in Speculative DecodingarXiv CL (cs.CL)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09338论文提出 Osprey,通过目标无关预训练打造更强的投机解码起草模型。针对现有起草模型针对单一目标模型窄分布训练、工作负载变化时接受率骤降的问题,该工作借鉴大模型预训练泛化思路,使起草器获得更广泛的泛化能力。SWORD: Wikidata-based Distortions Reveal Hidden Cross-Lingual Inconsistencies in LLM Factual Error RejectionarXiv CL (cs.CL)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09349论文提出 SWORD 基准,通过基于 Wikidata 三元组的受控扰动生成语法正确但事实错误的陈述,评估 LLM 能否跨语言一致地拒绝事实错误。该基准覆盖八种广泛使用语言,揭示现代 LLM 在多语言事实理解与错误拒绝上的隐藏不一致性。Auditable Emergency Triage for Maternal and Newborn Care in IndiaarXiv CL (cs.CL)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09356论文介绍 Noora Health 在印度母婴护理中构建的可审计紧急分诊系统,其 WhatsApp 服务每月处理超 5 万条医疗咨询。系统用 LLM 分类消息是否为紧急情况并提供理由,但原有系统不透明,分析错误需逐条阅读推理链,新方案提升可审计性。Do LLMs Make More Mistakes If They Do Not Believe the Input Data?arXiv CL (cs.CL)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09363论文研究 LLM 在不相信输入数据时是否更易出错,分析模型对上下文可信度的感知(上下文-记忆冲突)如何影响忠实度。研究利用非英语和低资源语言文本生成及本地知识输入的更高难度,识别错误模式,对 RAG 和数据到文本系统有启示。Benchmarking Hybrid Deep Research Across Database Querying and Web SearcharXiv CL (cs.CL)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09410论文提出跨数据库查询与网络搜索的混合深度研究基准,评估智能体在结构化与非结构化环境间切换的能力。针对现有基准孤立评估两种模态、无法捕捉关键「交接」能力的问题,该基准要求智能体融合开放网络文本与关系数据库精确数据完成复杂分析。Edu-QuRating: Multi-Dimensional Educational Data Curation with Distilled Pairwise JudgementsarXiv CL (cs.CL)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09425论文提出 Edu-QuRating,一种基于蒸馏成对判断的多维教育数据筛选流水线。针对现有教育数据过滤器将教育价值视为单一标量、过于宽泛的问题,该方法从准确性、吸引力、结构性和受众适配性等多维度评估学习材料,改进语言模型预训练数据质量。The Mutations of Machine SpeecharXiv CL (cs.CL)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09496论文从法律与社会视角追溯算法输出的演变,提出「机器言语的突变」概念。第一重突变将言语重新定义为可查询的数据,搜索引擎把网络从信息检索空间转变为可查询空间,探讨法律在促成和构成这些过程中的作用及其社会影响。TEFM: Token-Efficient Faithful Modeling for Structured DataarXiv CL (cs.CL)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09552TEFM框架用行为码压缩结构化数据,兼顾token效率与推理忠实性。BuzzASR: A Swarm of 100+ Monolingual Speech Recognition ModelsarXiv CL (cs.CL)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09554BuzzASR发布102种语言专用Whisper微调模型集合,提升低资源语言ASR。Towards Automatic Evolution Tree Generation from Citation GraphsarXiv CL (cs.CL)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09561EvoTree从引用图自动生成方法演化树,解耦概念骨架与时间细化。Reproducing Omitted Temporal Expressions in Japanese News for Retrieval-Augmented ApplicationsarXiv CL (cs.CL)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09569利用发布日期补全日文新闻省略的时间表达,提升检索与RAG稳定性。Beyond Top Words: MonoTM for Topic Modeling with Interpretable Monosemantic FeaturesarXiv CL (cs.CL)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09575MonoTM用稀疏自编码器提取单义特征做主题建模,超越词级描述。SEA-SpeechBench: A Large-Scale Multitask Benchmark for Speech Understanding Across Southeast AsiaarXiv CL (cs.CL)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09672SEA-SpeechBench首个覆盖11种东南亚语言的大规模多任务语音理解基准。Spectral origin of the topological gap exponent d + {\eta}: mechanism, kernel, decomposition, and scopearXiv LG (cs.LG)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09159解析拓扑间隙指数d+η的谱起源,给出核函数与体积/形状分解。Physics-informed neural networks by Gradient-Guided Gaussian Adaptive Sampling (3GAS-PINNs)arXiv LG (cs.LG)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.091623GAS-PINNs用梯度引导高斯自适应采样,改善PINN收敛与激波捕捉。World-Time Compute with Verified Code World ModelsarXiv LG (cs.LG)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09163用可验证代码世界模型生成轨迹做世界时间计算,提升LLM跨域泛化。Scaling Post-Training Ternarisation to Qwen3-8B Capability Retention, Reproduction, Lossless Packing, and Packed ExecutionarXiv LG (cs.LG)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09240将Qwen3-8B后训练三值化流程规模化,验证能力保持与无损打包执行。Distribution-Consistent Inference for Dynamic Sparse Mixture-of-ExpertsarXiv LG (cs.LG)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09241针对动态稀疏MoE提出分布一致推理,修正动态top-k路由的分布偏移。DiffLUT-Net: Differentiable Training of FPGA LUT Networks with Learnable ConnectivityarXiv LG (cs.LG)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09254DiffLUT-Net可微训练FPGA六输入LUT网络,联合学习真值表与连线。Accountable and uncertainty-aware evaluation of sensor-based AI under distribution shift: devices, subjects, and nearly three years undergroundarXiv LG (cs.LG)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09257提出面向传感器AI的问责式不确定性评估协议,分阶段考察分布偏移。Literati: Towards Anytime Optimal Shape Generalized Trees via AO*arXiv LG (cs.LG)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09299Literati用AO*实现随时最优的形状广义树,超越轴对齐分裂。Explaining f-Divergence-Based Regularization via Local Curvature and Sharpness-Aware MinimizationarXiv LG (cs.LG)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09367从局部曲率与SAM视角解释f散度正则化,证明二者局部一致。Constraint-Aware Discrete Black-Box Optimization Using Tensor DecompositionarXiv LG (cs.LG)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09370用张量分解做约束感知的离散黑盒优化,建模逻辑可行性规则。XAI-Refine: An Automated Explanation-Knowledge Loop for Brain-Age PredictionarXiv LG (cs.LG)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09388XAI-Refine构建自动解释-知识闭环,迭代改进脑龄预测模型。Applying foundation model embeddings towards urban livability evaluationarXiv LG (cs.LG)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09429评估基础模型嵌入对城市宜居性指标的预测能力与地理特征编码。SCCM : Stream Cruise Control Method for Automated Drift Detection and AdaptationarXiv LG (cs.LG)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09432SCCM流巡航控制框架,自动检测概念漂移并在线自适应回归。Efficient Leakage-Free Neural Architecture Search under Leave-One-Subject-Out EvaluationarXiv LG (cs.LG)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09433提出无泄漏分块NAS,在LOSO评估下共享搜索降低O(N²)开销。Tensor-Train Weak SINDy: Identifying High-Dimensional Nonlinear DynamicsarXiv LG (cs.LG)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09434TT-WSINDy结合张量列车与弱形式SINDy,高效发现高维非线性动力学。Evidence-Order Calibration for Selective Visual Reasoning under Progressive Loss of Question-Critical EvidencearXiv CV (cs.CV)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09184研究VLM在问题关键证据逐步丢失下的选择性视觉推理与置信度校准。Integrating Unimodal and Vision-Language Representations in Latent Space for Multi-Label Chest X-Ray ClassificationarXiv CV (cs.CV)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09185融合RAD-DINO单模态与BioViL-T视觉语言表示,提升胸片多标签分类。M2LG-DG: A Multi-modal Local-Global Domain Generalization Framework for Cross-site Major Depressive Disorder ClassificationarXiv CV (cs.CV)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09186M2LG-DG多模态局部-全局域泛化框架,用于跨站点抑郁症分类。AgenticGen: Reward-Guided Agentic Video Generation for AdvertisingarXiv CV (cs.CV)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09187AgenticGen用奖励引导的智能体框架生成广告视频,闭环在线业务反馈。Lensless Gaze Is Not Private by Default: Auditing Identity Leakage Across Disclosure SurfacesarXiv CV (cs.CV)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09188审计无透镜眼动追踪的身份泄露,揭示视觉不可读不等于隐私安全。MLLMs Hallucinate when Information Distribution Drifts in Synergy HeadsarXiv CV (cs.CV)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09206提出HEAL,通过头级信息解耦与校准定位并缓解多模态大模型幻觉。Video-MOPD: Multi-Teacher On-Policy Distillation for Video UnderstandingarXiv CV (cs.CV)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09300Video-MOPD-8B用多教师在线策略蒸馏统一视频时序定位、理解与STEM推理。DensePol: Dense-Angle Polarization Dataset for Learning-Based Polarimetric VisionarXiv CV (cs.CV)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09359发布DensePol密集角度偏振数据集,提升基于学习的偏振视觉监督保真度。The Living Library: Transforming Archival Collections into Conversational Knowledge Systems -- Lessons from the Theodore Roosevelt Presidential LibraryarXiv CV (cs.CV)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09368Living Library框架将档案库转为可对话知识系统,已在罗斯福总统图书馆落地。OmniPoint: Universal Monocular Metric Pointcloud from Any CameraarXiv CV (cs.CV)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09394OmniPoint统一框架从任意相机(针孔/鱼眼/全景)单目恢复度量点云。VANTAGE-Bench: Evaluating the Infrastructure AI Gap in Vision-Language ModelsarXiv CV (cs.CV)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09396VANTAGE-Bench评测视觉语言模型在基础设施AI场景(物流/交通/智能空间)的能力缺口。Vision-language models know more about agriculture than they show and rubric-grounded verifications close the gaparXiv CV (cs.CV)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09417构建农业VLM基准,发现模型视觉特征足够但知识连接不足,用评分标准验证弥补差距。Longitudinal tracking of multiple sclerosis lesions in the spinal cord: A validation studyarXiv CV (cs.CV)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09424比较五种脊髓MS病灶纵向MRI追踪策略,实现实例级跨时间对应。Low-Rank Prompt Learning for Vision-Language Models with Fixed-Token BasesarXiv CV (cs.CV)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09462用低秩分解压缩CLIP提示学习参数,固定token基后仅需rd个可训练参数。LeCor: Learning to Be Corrected by Meta-Learned Test-Time Training for Interactive 3D Lung-Tumour SegmentationarXiv CV (cs.CV)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09477LeCor用元学习测试时训练让SAM 3在交互式3D肺肿瘤分割中学会被纠正。A Subsampled Davis-Kahan Bound for Large-Scale Eigenspace EstimationarXiv ML (stat.ML)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09211提出子采样Davis-Kahan界,用Bernoulli采样近似大规模矩阵特征空间。Critical initialization destabilizes higher input derivatives in wide scalar-input networksarXiv ML (stat.ML)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09244证明临界初始化会破坏宽标量输入网络的高阶输入导数稳定性。What Fixed-Rollout pass@k Evaluations Can IdentifyarXiv ML (stat.ML)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09245证明固定rollout的pass@k评估只能识别n个矩,外推k>n不可靠。CAST: Canonical Approximate Schur Tree for Approximate Cholesky on GraphsarXiv ML (stat.ML)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09255CAST用规范近似Schur树改进图上的近似Cholesky预条件子构造。Tensor Network Moral Graph Recovery of Discrete Probability DistributionsarXiv ML (stat.ML)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09258用张量网络与核范数正则从离散分布恢复因果DAG的道德图。Mode Coverage in Normalizing Flow Boltzmann Generators via Log-Ratio VariationarXiv ML (stat.ML)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09473提出对数比变差KLXX损失,改善归一化流玻尔兹曼生成器的模式覆盖。Recovery Theory for Projected Power Iterations in Permutation SynchronizationarXiv ML (stat.ML)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09502证明投影幂法在稀疏均匀损坏模型下可精确一步恢复置换同步。High-probability guarantees for linear accessibility in feature superpositionarXiv ML (stat.ML)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09556将线性可达性建模为压缩感知,证明维度需求为线性而非二次。Learning with Synthetic Data via SGD in High-Dimensional Linear RegressionarXiv ML (stat.ML)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09572分析高维线性回归中合成数据对SGD泛化的影响与模型坍缩风险。Distillation of Synthetic Data for Time Series Foundation ModelsarXiv ML (stat.ML)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09586提出合成数据蒸馏SDD,用时序基础模型匹配条件预测分布而非实现值。Why Learning Rediscovers the Closed-Form Diagonal RegularizerarXiv ML (stat.ML)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09656揭示模态反问题中学习会重新发现闭式对角正则化器的饱和原理。A Unifying Perspective on Probabilities as Model PredictionsarXiv ML (stat.ML)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09855提出概率即预测方法的统一视角,调和贝叶斯与频率派分歧。FlowCPO: A Unified Divergence View of Preference Alignment for Flow ModelsarXiv ML (stat.ML)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09905FlowCPO用散度统一视角实现流模型离线偏好对齐的前向KL目标。Optimal Value Inference for Reinforcement LearningarXiv ML (stat.ML)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.09981提出最优价值推断的去偏估计器,基于自诱导Bellman方程与Neyman正交性。A statistical approach to bias in zero-shot learning: the lens of handwriting recognitionarXiv ML (stat.ML)2026-09-10T04:00:00Zhttps://arxiv.org/abs/2609.10084从统计视角分析零样本学习中的偏差问题,以手写词识别为验证场景。:fire: 对话即是开发—— ApiGo 智能数据服务平台开源中国2026-09-10T03:30:35Zhttps://www.oschina.net/news/502402ApiGo 提出「对话即是开发」的智能数据服务平台,将数据库转化为安全、受治理、可被 AI 调用的数据服务,用户只需一句话即可生成查询接口。该方案针对传统开发中接口排期长、鉴权限流文档监控需重复搭建的痛点,试图大幅缩短从数据到服务的链路。一周连发6个模型!这家公司把具身智能的闭环跑通了量子位2026-09-10T04:55:38Zhttps://www.qbitai.com/2026/09/486625.html某公司一周内连续发布6个具身智能模型,宣称已跑通从数据采集到部署的完整闭环。报道强调模型可以开源,但真实场景的部署经验难以复制,凸显具身智能落地中工程化能力比模型本身更关键。DeepSeek V4.1 Flash 正式发布:更强、更快、更普惠开源中国2026-09-10T07:18:45Zhttps://www.oschina.net/news/502405/deepseek-v4-1-flash-gaDeepSeek 正式发布 V4.1 Flash,是其全新模型结构系列中最小尺寸的版本,具备原生多模态视觉理解能力。该模型为 552B 参数的 MoE 架构,采用非对称设计,主打更高能力上限、更快推理速度与更大吞吐,并可扩展至更大参数规模。每周被安装 1.1 亿次的 Tailwind 被 Shopify 收购了开源中国2026-09-10T07:10:59Zhttps://www.oschina.net/news/502404/tailwind-is-joining-shopify每周被安装 1.1 亿次的开源 CSS 框架 Tailwind 被 Shopify 收购,创始人 Adam Wathan 宣布 Tailwind Labs 加入 Shopify。公告坦言该项目在商业层面已难以为继,反映出高使用量开源项目在可持续变现上的普遍困境。DeepSeek AI Released DeepSeek-V4.1-Flash with 1M Context, FP4 KV Cache, and Cross-Layer Attention ReuseMarkTechPost2026-09-10T07:31:01Zhttps://www.marktechpost.com/2026/09/10/deepseek-ai-released-deepseek-v4-1-flash-with-1m-context-fp4-kv-cache-and-cross-layer-attention-reuse/DeepSeek发布DeepSeek-V4.1-Flash,采用552B主干加196B Engram参数的多模态MoE架构,支持100万token上下文。针对长程Agent带来的KV缓存压力,引入FP4 KV Cache与跨层注意力复用,缓解HBM与带宽瓶颈。AGI时代的第一个生图模型,ChatGPT Images 2.5上线量子位2026-09-10T07:25:39Zhttps://www.qbitai.com/2026/09/486684.htmlChatGPT Images 2.5 上线,被定位为AGI时代的首个生图模型。该版本主打更快的生成速度与更精细的画面细节,同时改图能力大幅提升,操作体验更接近专业修图。营销科技巨头蓝色光标与全球达人营销AI平台AhaCreator达成深度合作,让品牌更高效连接全球500万创作者量子位2026-09-10T06:25:22Zhttps://www.qbitai.com/2026/09/486651.html营销科技巨头蓝色光标与全球达人营销AI平台AhaCreator达成深度合作,借助AI帮助品牌更高效连接全球500万创作者。合作将单次投放升级为可规模化复制的增长系统,推动海外达人营销自动化。Ubuntu 设计团队往事:品味是如何死在投票箱里的?开源中国2026-09-10T07:58:03Zhttps://www.oschina.net/news/502408前 Canonical 设计师 David Siegel 复盘 2009 年 Ubuntu 首支设计团队的失败经历,指出由 Debian 资深开发者投票决定启动器动画等设计细节的机制,最终扼杀了产品品味。该帖近期被重新翻出,引发对开源社区设计决策流程的反思。全球首个3D原生城市世界模型ABot-Earth 0.7发布,构建AI理解真实世界的入口量子位2026-09-10T08:17:05Zhttps://www.qbitai.com/2026/09/486900.html高德发布全球首个3D原生城市世界模型ABot-Earth 0.7,定位为AI理解真实世界的入口。该模型以3D原生方式构建城市级世界模型,区别于传统2D视频生成路线,有望服务自动驾驶、机器人导航与空间智能等场景。全球首个可仿真的人–场景交互重建框架 HSImul3R:让人类视频真正成为机器人技能来源量子位2026-09-10T07:57:55Zhttps://www.qbitai.com/2026/09/486747.html大晓机器人联合南洋理工大学S-Lab、上海人工智能实验室发布人-场景交互重建框架HSImul3R,号称全球首个可仿真版本。该框架能从人类视频中重建可仿真的人-场景交互,使人类视频成为机器人技能学习的数据来源,降低机器人数据采集成本。这个新开源的世界模型只有1.3B,单卡就能实时跑!量子位2026-09-10T07:44:00Zhttps://www.qbitai.com/2026/09/486716.html轻量版世界模型LingBot-World 2.0开源,参数量仅1.3B,单张显卡即可实时运行。该模型大幅降低世界模型的部署门槛,为实时交互式生成与具身智能研究提供低成本可复现方案。Top AI spenders cut per-employee costs by nearly 10 percent in AugustThe Decoder2026-09-10T09:34:21Zhttps://the-decoder.com/top-ai-spenders-cut-per-employee-costs-by-nearly-10-percent-in-august/Ramp AI 指数显示,美国头部 1% 企业的员工人均 AI 支出在 8 月环比下降近 10%,百万 token 价格自 2026 年 3 月以来已下跌 41%。企业正主动将用量从昂贵的前沿模型转向更便宜的替代方案,OpenAI、Anthropic 等厂商面临量增能否抵消价跌的考验。Clearview AI Is Testing an AI Tool That Would Let Cops Unearth Your Life OnlineWired AI2026-09-10T10:00:00Zhttps://www.wired.com/story/clearview-ai-is-testing-an-ai-tool-that-lets-cops-instantly-unearth-your-online-activity/Clearview AI 正在测试一款名为 InquiryIQ 的未公开原型工具,可让执法人员在锁定目标后自动挖掘其社交账号、关联人脉等网络信息。该工具调用了 xAI(Grok 开发商)的模型,进一步模糊了人脸识别与大规模网络画像之间的界限,引发隐私与滥用担忧。Everything New You Can Do With Siri AIWired AI2026-09-10T10:30:00Zhttps://www.wired.com/story/everything-new-you-can-do-with-siri-ai/Wired 报道称,随着 iOS 27 的到来,Siri 将迎来全面重构的 AI 助手版本,为 iPhone 用户带来全新功能体验。这标志着苹果在 AI 助手领域的重要升级。AI safety panic goes mainstream after Anthropic researcher's warnings land on CNN and Fox NewsThe Decoder2026-09-10T10:31:20Zhttps://the-decoder.com/ai-safety-panic-goes-mainstream-after-anthropic-researchers-warnings-land-on-cnn-and-fox-news/即将离职的 Anthropic 研究员 Jacob Coxon 在 CNN 和 Fox News 上警告自我改进 AI 对人类构成生存威胁,引发主流媒体广泛关注。Anthropic 和 OpenAI 的安全研究员持类似观点,美国政界和 Joe Rogan 也加入讨论,但灭绝场景仍属极端且有争议的立场。ECCV上,顶尖学者们开始研究如何让AI做生意了量子位2026-09-10T10:17:46Zhttps://www.qbitai.com/2026/09/486934.html在 ECCV 上,多位多模态 AI 顶尖学者开始探索如何让 AI 辅助商业决策与运营,全球 64 支团队组团参与解题。这反映出学术界正将多模态大模型能力从感知任务向商业应用场景延伸。通用代码生成器:光船尝鲜版二,蛋糕船示例生成演示开源中国2026-09-10T10:35:07Zhttps://www.oschina.net/news/502409开源通用代码生成器「光船」发布尝鲜版二,通过蛋糕船示例演示了从数据库后端到 Node.js Vue 前端的完整代码生成流程。该版本修复了数据磨坊功能群、SQL 文件代码生成及前端代码生成等大量缺陷,可用示例和功能显著增强。Rebuilding AUTOMATIC1111 with Gradio WorkflowHugging Face Blog2026-09-10T00:00:00Zhttps://huggingface.co/blog/gradio-workflow-1111Hugging Face 博客介绍如何用 Gradio Workflow 重建 AUTOMATIC1111(Stable Diffusion WebUI)。文章展示了以 Gradio 组件与工作流编排替代原有架构的实践思路,为扩散模型前端部署提供更模块化、易维护的方案。Powering AI is an architecture problemMIT Tech Review AI2026-09-10T11:00:00Zhttps://www.technologyreview.com/2026/09/10/1141649/powering-ai-is-an-architecture-problem/MIT Tech Review 指出 AI 能耗瓶颈本质是电网架构问题。文章以弗吉尼亚 Ashburn 数据中心集群为例:2026 年一次输电线路故障数秒内甩掉超 3GW 负荷,两年前一次避雷器失效也曾导致约 60 处设施、1500MW 同时掉线。Mathematicians want proof OpenAI didn’t use their workThe Verge AI2026-09-10T11:00:57Zhttps://www.theverge.com/ai-artificial-intelligence/993263/where-does-openai-get-mathematics-training-data又一位数学家公开质疑 OpenAI 训练数据来源,指控其行为不道德、不诚实且缺乏透明度。此前数日已因模型是否受益于未发表成果爆发争议,此事凸显 AI 巨头在数学发现领域的数据合规与版权问题持续发酵。对话极壳创始人孙宽:年出货 3 万台后,外骨骼「全班第一」的成长和焦虑极客公园2026-09-10T11:41:33Zhttp://www.geekpark.net/news/370150极壳 Hypershell 去年全球出货超 3 万台,成为消费级外骨骼领域头号玩家,创始人孙宽在访谈中谈及行业竞争与成长焦虑。2025 年被视为消费级外骨骼元年,上百新玩家涌入,极壳在 IFA 发布行业首个髋膝一体化下肢外骨骼新品 Halo。Muse can shop, write emails, and negotiate prices for users, all through WhatsAppThe Decoder2026-09-10T12:27:18Zhttps://the-decoder.com/muse-can-shop-write-emails-and-negotiate-prices-for-users-all-through-whatsapp/Meta 发布 AI Agent「Muse」,可通过 WhatsApp 帮用户订旅行、购物、发邮件甚至议价,并借助 Stripe 的 Link 完成支付。Meta 还配套推出安全 Agent「Sentinel」,在每次操作触网前进行监控,此举使 Meta 在 Agent 商业化落地上领先于已停用 ChatGPT 直接结账功能的 OpenAI。Nvidia and Palantir team up to run supply chains with AI, starting with Nvidia's own million-part operationThe Decoder2026-09-10T12:23:16Zhttps://the-decoder.com/nvidia-and-palantir-team-up-to-run-supply-chains-with-ai-starting-with-nvidias-own-million-part-operation/英伟达与 Palantir 宣布合作,用 AI 驱动供应链运营,首个落地场景是英伟达自身涉及百万级零部件的供应链体系。该合作将 Palantir 的数据与决策平台同英伟达的算力与 AI 能力结合,瞄准制造业与物流等复杂供应链场景的智能化改造。New Deepseek model V4.1-Flash cuts memory needs for AI agentsThe Decoder2026-09-10T12:40:51Zhttps://the-decoder.com/new-deepseek-model-v4-1-flash-cuts-memory-needs-for-ai-agents/Deepseek 发布多模态模型 V4.1-Flash,总参数 5520 亿、每 token 仅激活 160 亿,KV cache 内存降至前代四分之一。在 DeepSWE 编程基准上小幅超越 Opus 5 和 GPT-5.6 Sol,并以 MIT 许可开源,主打更低成本的 AI Agent 场景。iPhone 18 Pro 发布速览:「面子」变化不大,「里子」全面升级爱范儿2026-09-10T13:11:37Zhttps://www.ifanr.com/1679651?utm_source=rss&utm_medium=rss&utm_campaign=苹果发布 iPhone 18 Pro,外观设计延续前代风格,但内部硬件全面升级,包括新一代芯片、影像系统和电池续航,售价也进一步上涨。整体呈现“面子变化不大、里子大幅提升”的产品策略。GPT-6 Astra gives mathematicians a breather, and OpenAI says that's by designThe Decoder2026-09-10T13:45:32Zhttps://the-decoder.com/gpt-6-astra-gives-mathematicians-a-breather-and-openai-says-thats-by-design/OpenAI 的 GPT-6 Astra 在 ErdosBench 开放数学问题上登顶,但首席科学家 Pachocki 称数学并非优先方向,资源正投向递归自我改进与对齐研究。这印证了 AI 发展日益「尖峰化」,即在特定领域极强而非全面进步。20.99 万元起!全新智己 LS6 预售,全线控底盘全系标配爱范儿2026-09-10T13:52:09Zhttps://www.ifanr.com/1679681?utm_source=rss&utm_medium=rss&utm_campaign=智己全新 LS6 开启预售,起售价 20.99 万元,全系标配全线控底盘。该底盘技术此前多用于高端车型,此次下放到 20 万级市场,有望推动线控底盘在主流电动车中的普及。补贴后 12.99 万元起,银河 TT 上市:全系 800V+宁德时代定制电池爱范儿2026-09-10T13:46:20Zhttps://www.ifanr.com/1679668?utm_source=rss&utm_medium=rss&utm_campaign=吉利银河 TT 正式上市,补贴后起售价 12.99 万元,全系标配 800V 高压平台和宁德时代定制电池。该定价将 800V 架构拉入 13 万级市场,对同价位纯电车型形成较大竞争压力。走出聊天框,Agent 开始进入现实世界极客公园2026-09-10T13:39:07Zhttp://www.geekpark.net/news/370064Agent 正从屏幕内的文件与网页操作走向现实世界,硬件成为关键入口。腾讯发布九款联名智能硬件,Google 将 Gemini 带入家居设备,Amazon 用 Alexa+ 连接终端,Agent 竞争已越过聊天框进入设备与物理场景。微信,悄悄迈出 AI 社交的第一步极客公园2026-09-10T13:36:57Zhttp://www.geekpark.net/news/370155微信小范围测试「小微 AI 社交」功能,用户可让各自的小微代理先行沟通,再回来确认关键决策。AI 未直接进入私人对话,而是在双方之间建立代理通道,社交平台连接对象或从「人与人」扩展为「代理与代理」。Why the current tech backlash feels differentThe Verge AI2026-09-10T14:00:00Zhttps://www.theverge.com/podcast/992141/decoder-mailbag-ai-backlash-surveillance-midterms-data-centersThe Verge 播客 Decoder 讨论当前科技行业遭遇的公众反弹为何与以往不同。主持人 Nilay Patel 与制作团队探讨了 AI 时代科技公司面临的社会信任危机及其深层原因。Maven Robotics wants to steal your robot deployment dealTechCrunch AI2026-09-10T14:17:37Zhttps://techcrunch.com/2026/09/10/maven-robotics-wants-to-steal-your-robot-deployment-deal/机器人初创公司 Maven Robotics 正式结束隐身模式,宣布完成 1 亿美元 A 轮融资,并已拥有多个实际部署项目。该公司瞄准机器人部署市场,试图从现有玩家手中争夺客户订单。AI agents are flooding public services with new requestsTechCrunch AI2026-09-10T14:53:50Zhttps://techcrunch.com/2026/09/10/ai-agents-are-flooding-public-services-with-new-requests/TechCrunch报道,AI代理正大量涌入公共服务系统提交申请,导致请求量激增。研究者指出,绝大多数案例其实是符合资格的人正常申领福利,并非恶意滥用,这暴露出公共服务系统在应对AI自动化访问时的承载与审核压力。Now everyone can put data to workOpenAI Blog2026-09-10T15:00:00Zhttps://openai.com/index/put-data-to-workOpenAI 在 ChatGPT Work 中推出 Data agent,用户可用自然语言连接企业数据、挖掘洞察并生成交互式仪表盘。这标志着 ChatGPT 从对话助手进一步向企业数据分析与 BI 场景延伸,降低非技术用户使用数据的门槛。Expanding AI access and cyber defense for federal, state, local, and tribal governmentsOpenAI Blog2026-09-10T07:00:00Zhttps://openai.com/index/expanding-ai-access-us-governmentOpenAI 与美国 GSA 合作,向符合条件的联邦、州、地方及部落政府提供零许可费、使用量五折优惠及更强网络防御支持。此举意在扩大 AI 在公共部门的落地,同时强化政府场景的安全防护能力。Meta’s Muse AI works and creeps me outThe Verge AI2026-09-10T15:00:00Zhttps://www.theverge.com/tech/993391/meta-muse-ai-hands-onMeta 推出新 AI 助手 Muse,首次真正进军 AI 生产力工具,宣称其 Agent 可代劳网购、邮件、行程规划等事务。作者实测后认为功能可用但体验令人不安,反映出消费级 AI Agent 在实用性与隐私边界上仍存争议。Claude Fable 5.1's language is less "load-bearing" than its predecessor'sThe Decoder2026-09-10T15:26:58Zhttps://the-decoder.com/claude-fable-5-1s-language-is-less-load-bearing-than-its-predecessors/Arena.ai 分析数万条基准回答后发现,Claude Fable 5.1 相比前代写作更平实、少“承重”修辞,但篇幅也更冗长。该研究揭示了模型迭代中语言风格与信息密度的微妙变化,对评估模型输出质量有参考意义。Universal Music is launching an AI music platform with ElevenLabsThe Verge AI2026-09-10T15:38:19Zhttps://www.theverge.com/ai-artificial-intelligence/993465/universal-music-elevenlabs-ai环球音乐集团与AI音频公司ElevenLabs达成多年授权协议,将推出AI音乐创作平台,允许用户基于其正版曲库生成混音、串烧和改编作品。这是大型唱片公司首次系统性开放版权内容用于AI二次创作,标志着音乐产业与生成式AI从对抗走向合作。Build more natural voice experiences with GPT‑Live‑1 in the APIOpenAI Blog2026-09-10T00:00:00Zhttps://openai.com/index/introducing-gpt-live-1-in-the-apiOpenAI 在 API 中推出 GPT‑Live‑1,支持自然全双工语音对话,并具备更强的指令遵循、自定义音色和电话集成能力。该模型面向开发者开放,可用于构建更自然的语音交互应用,标志着实时语音 Agent 能力进一步落地。Sep 10, 2026Frontier Red TeamMeasuring tactical intelligence targeting and conventional weapons capabilities of AI modelsAnthropic Research2026-09-10T00:00:00Zhttps://www.anthropic.com/research/intelligence-targeting-conventional-weapons-capabilitiesAnthropic前沿红队发布研究,评估AI模型在战术情报瞄准和常规武器能力方面的表现。该研究旨在量化模型可能带来的安全风险,为AI军事化应用的治理提供依据。Introducing ChatGPT for Financial ServicesOpenAI Blog2026-09-10T07:00:00Zhttps://openai.com/index/introducing-chatgpt-financial-servicesOpenAI 推出面向金融服务的 ChatGPT 产品,内置金融数据并集成 GPT-6 Astra 模型,可支持研究、建模和生成面向客户的材料。此举标志着大模型在金融垂直行业的商业化落地进一步加速。Introducing the Agents APIOpenAI Blog2026-09-10T00:00:00Zhttps://openai.com/index/introducing-the-agents-apiOpenAI 发布 Agents API,提供托管式云 Agent 构建与部署服务,底层由 Codex harness 驱动,支持任务编排、长时运行会话和工具调用。该服务降低了开发者构建生产级 Agent 的门槛,标志着 OpenAI 在 Agent 基础设施层的进一步布局。Async GRPO with LoRA across HF Jobs: a bucket, a proxy, and no NCCLHugging Face Blog2026-09-10T00:00:00Zhttps://huggingface.co/blog/asyncgrpo-lora-hfjobsHugging Face 博客介绍了一种在 HF Jobs 上跨节点异步运行 GRPO 与 LoRA 的方案,通过对象存储桶和代理通信绕开 NCCL,降低了分布式强化学习训练的工程门槛。该方案对资源受限或异构环境下的 LLM 后训练具有实用价值。PyTorch Conference China 2026: Advancing the Open Source AI StackPyTorch Blog2026-09-10T00:01:29Zhttps://pytorch.org/blog/pytorch-conference-china-2026-advancing-the-open-source-ai-stack/PyTorch Conference China 2026在上海举行,与KubeCon、OpenInfra Summit同期,聚焦开源AI栈的技术进展。会议汇聚社区开发者,讨论PyTorch生态在训练、推理与部署方面的最新方向。High-Throughput Structure Prediction with BioNeMo Inference RuntimeNVIDIA Developer Blog2026-09-10T15:00:00Zhttps://developer.nvidia.com/blog/high-throughput-structure-prediction-with-bionemo-inference-runtime/NVIDIA推出BioNeMo推理运行时,面向蛋白质组规模的高通量结构预测,优化整批任务的流水线效率。该工具旨在把生物分子结构预测从单次实验推进到规模化生产。From Wafer-Out to First Token: Codifying Supply Chain Expertise with Nemotron and Palantir FoundryNVIDIA Developer Blog2026-09-10T09:00:00Zhttps://developer.nvidia.com/blog/from-wafer-out-to-first-token-codifying-supply-chain-expertise-with-nemotron-and-palantir-foundry/NVIDIA联合Palantir Foundry,用Nemotron模型将供应链专业知识编码化,覆盖从晶圆产出到首个Token的全流程。案例展示大模型如何把复杂制造与物流经验沉淀为可查询的智能系统。When to Use Encode-Prefill-Decode Disaggregation to Accelerate Multimodal Model ServingNVIDIA Developer Blog2026-09-09T20:31:04Zhttps://developer.nvidia.com/blog/when-to-use-encode-prefill-decode-disaggregation-to-accelerate-multimodal-model-serving/NVIDIA撰文分析多模态模型服务中何时应采用Encode-Prefill-Decode分离架构,将视觉编码与预填充阶段解耦。该技术可提升多模态推理吞吐,但需权衡部署复杂度与收益。CUDA Toolkit 13.4 Adds Windows on Arm Support and Greater Control over Shared GPUsNVIDIA Developer Blog2026-09-09T20:24:12Zhttps://developer.nvidia.com/blog/cuda-toolkit-13-4-adds-windows-on-arm-support-and-greater-control-over-shared-gpus/CUDA Toolkit 13.4发布,新增Windows on Arm支持并加强对共享GPU的控制能力。更新让开发者能在Arm PC上使用CUDA,并更精细地管理多任务共享GPU资源。
Meta 发布 AI Agent「Muse」,可通过 WhatsApp 帮用户订旅行、购物、发邮件甚至议价,并借助 Stripe 的 Link 完成支付。Meta 还配套推出安全 Agent「Sentinel」,在每次操作触网前进行监控,此举使 Meta 在 Agent 商业化落地上领先于已停用 ChatGPT 直接结账功能的 OpenAI。
即将离职的 Anthropic 研究员 Jacob Coxon 在 CNN 和 Fox News 上警告自我改进 AI 对人类构成生存威胁,引发主流媒体广泛关注。Anthropic 和 OpenAI 的安全研究员持类似观点,美国政界和 Joe Rogan 也加入讨论,但灭绝场景仍属极端且有争议的立场。
Sebastian Raschka 发布万字长文拆解 GPT-6 Astra,称其可能是自己用过最好的模型,但重点在于追查 The Information 关于 Astra 采用「循环深度」(looped transformer)架构的传闻。文章系统梳理了循环架构的技术原理与推理链机制,为理解下一代大模型架构演进提供了重要参考。