每日时间线 · 9月28日 · 北京时间 UTC+8
2026-09-28 的 AI 热点
当天共 76 条,其中 35 条 70 分以上。按本站收录时间排列,晚发布的来源也会算进当天。点标题看详情,X 推文直接打开原帖。
- 量子位70行业动态清华系量子AI团队估值10亿,改造大模型底层清华背景量子AI创业团队获10亿估值,用量子技术优化大模型底层架构
- 量子位70产品发布/更新3 家报道桌面级量子计算小盒子发布,端到端跑通数据不出门桌面量子计算设备已跑通端到端流程,数据无需外传,降低开发者使用门槛
- 量子位70模型发布/更新匿名玉兔模型登顶OpenRouter双榜,Coding能力优异玉兔模型登顶OpenRouter双榜,中秋稳坐日榜首,编程实测表现突出原文发布于 ,本站收录于
- TechCrunch AI83行业动态Anthropic CEO将与特朗普首次一对一共进晚餐Anthropic’s CEO is about to have dinner with President TrumpAnthropic首席执行官Dario Amodei即将与特朗普共进晚餐,此为双方首次一对一单独会面。
- The Verge AI74行业动态2 家报道OpenAI智能体被曝高频扫描联合国网站超1.6万次OpenAI agents tried to ‘bruteforce’ a UN website安全研究员发现OpenAI智能体4-6月扫描联合国贸发会议网站超1.6万次,凸显AI智能体安全风险。原文发布于 ,本站收录于
- The Verge AI67产品发布/更新Thoughtful Things推出AI音乐采样器Engram并开启众筹Engram is a sampler that turns broken AI hallucinations into music该AI采样器可将AI幻觉生成的音频转为音色,并非一键生成歌曲设备,正开启众筹。
- TechCrunch AI52行业动态媒体讨论Meta AI产品Muse能否破解其信任难题Can Muse overcome Meta’s trust issues?Equity播客讨论Meta的AI公告抢占OpenAI、Anthropic风头的现象及Muse前景。
- 量子位42行业动态4 家报道量子位称存在可致OpenAI最强模型训练崩溃的题目该资讯未披露具体题目及技术细节,仅提及存在可致OpenAI最强模型训练崩溃的题目。原文发布于 ,本站收录于
- TechCrunch AI28行业动态Anthropic CEO Amodei被《周六夜现场》恶搞Anthropic’s Dario Amodei gets the SNL treatment美国综艺《周六夜现场》推出恶搞Amodei的桥段,调侃其为AI的"造魔者"。原文发布于 ,本站收录于
- arXiv cs.AI35论文研究2 家报道提出面向机器感质的S3Q意识理论五层实现架构From S3Q Theory to Implementation: Towards an Architecture for Machine Qualia针对机器意识研究的理论落地难题,提出S3Q意识理论的五层计算实现架构
- arXiv cs.CL82论文研究新论文审计生产Text-to-SQL中LLM评委失效问题Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline实测生产环境中gpt-4o-mini作为LLM评委与人工标注一致性极低,提出修复方案。
- arXiv cs.CL82论文研究2 家报道新论文提出AI智能体联邦工具发现框架CartographCartograph: Federated Tool Discovery with Operator-Attested Retrieval for AI Agents针对MCP协议下工具目录过大的问题,提出联邦代理将遍历复杂度从O(n)降至O(k)。
- arXiv cs.CL82论文研究2 家报道新论文提出LLM智能体记忆诊断框架MemProbeProbing Stability-Plasticity Tradeoffs in Agent Memory through Cognitive Experimental Paradigms受认知科学启发,提出MemProbe框架,诊断LLM Agent记忆的稳定性与可塑性平衡。
- arXiv cs.CL82论文研究3 家报道新论文提出Web智能体知识综合能力新基准The Hard Part Comes After Search: Benchmarking Web Agents on Synthesizing, Organizing, and Displaying Knowledge现有Web Agent基准未覆盖知识综合能力,新基准评估该类复杂工作流表现。
- arXiv cs.AI82论文研究研究提出LLM智能体执行控制失效问题及优化架构LLM Parkinsonism: Executive-Control Failure, Token-Inefficient Persistence, and an Uncertainty-Aware Global Executive Control Architecture for Autonomous Language-Model Agents发现LLM智能体存在目标达成后冗余操作的控制缺陷,提出不确定性感知架构。
- arXiv cs.CL80论文研究Spotify分享对话推荐智能体自提升优化方案Bootstrapping Conversational Recommendation Agents At Spotify: Synthetic Data Generation and Self-Improvement LoopsSpotify提出对话推荐智能体的优化方案,通过合成数据与自提升循环优化规划能力。
- arXiv cs.CL80论文研究新论文探究医疗LLM答案检索式评估失效原因Where Does Retrieval-Based Open-Ended Evaluation Fail? Automatic Taxonomy Induction from Long-Form Medical Answer Factuality Verification分析医疗场景下检索式事实校验评估的失效模式,提出自动分类体系归纳方法。
- arXiv cs.CL80论文研究新论文提出生产级AI智能体评估框架CARGOCARGO: Context-Aware Retrieval-Gated Evaluation of Agentic AI in Production针对生产级智能体动态实体的评估问题,提出上下文感知的检索门控框架避免误判。
- arXiv cs.CL77论文研究新论文提出ASR推理时目标说话人遗忘机制Inference-Time Target Speaker Unlearning in LLM-Based Automatic Speech Recognition提出TSU-ASR任务,可在推理时让多说话人ASR系统跳过指定退出用户的语音转录。
- arXiv cs.CL77论文研究新论文发现语码转换训练可实现小模型跨语言对齐Feeding BabyLMs Macaroni: Code-Switching Curricula Cause Cross-Lingual Convergence实验发现用混合语码文本训练小型Transformer,可诱导跨语言对齐效果。
- arXiv cs.CL77论文研究KV缓存新淘汰策略:多样性感知分层打分机制Beyond Mean Attention: Diversity-Aware, Layer-Wise Scoring for KV Cache Eviction提出融合注意力离散度、冗余度的KV缓存打分方法,提升淘汰效率。
- arXiv cs.CL75论文研究2 家报道新论文提出LLM智能体分层协作记忆检索框架Not All Memories Are Equal: Hierarchical Collaborative Memory for Validity-Aware Retrieval in LLM Agents针对团队协作场景下LLM智能体的异构记忆,提出分层有效性感知的检索机制。
- arXiv cs.CL75论文研究新论文提出无训练多智能体幻灯片生成框架SlideLabSlideLab: Audience-Centered Scientific Slide Generation and EvaluationSlideLab是无训练多智能体框架,可从研究论文自动生成面向受众的科学演示幻灯片。
- arXiv cs.CL75论文研究2 家报道新论文提出LLM因果感知同传语音翻译框架All In Good Time: Causality-Aware Framework for LLM-Based Simultaneous Speech-to-Speech Translation针对LLM同传语音翻译的因果对齐数据缺失问题,提出因果感知的新框架。
- arXiv cs.CL75论文研究2 家报道新论文提出语音智能体可靠性评估协议Inquesto ScoreInquesto Score: A reliability Protocol For Voice Agents提出可复现、可解释的语音智能体可靠性评估协议,通过版本化测试集统计成功率。
- arXiv cs.AI75论文研究BioEVAL:全球多机构联合推出的生物工程大模型基准BioEVAL: A global, multi-institutional benchmark of large language and multimodal models for bioengineering联合全球多机构推出面向生物工程领域的LLM与多模态模型评测基准,覆盖前沿任务。
- arXiv cs.AI75论文研究新研究:音频LLM可识别自身转录失效场景Audio LLMs Know When They Can't Hear You针对音频LLM在退化音频下的转录错误问题,提出模型转录可靠性评估框架。
- arXiv cs.AI75论文研究CRC-Router:面向医疗AI智能体的风险约束路由机制CRC-Router: Risk-Constrained Routing for Medical Agentic AI Systems针对医疗AI Agent自主决策的安全风险,提出风险约束路由方案降低临床隐患。
- arXiv cs.AI75论文研究研究分析编码AI智能体的成本低效行为及缓解方案Analyzing and Mitigating Cost-Inefficient Behaviors in Coding Agents基于1200条代码Agent运行轨迹,梳理其成本过高的核心行为问题并给出缓解思路。
- arXiv cs.AI75论文研究2 家报道研究提出多LLM智能体工作流的低耗步骤跳过方案Learning What to Skip: Counterfactual Credit Assignment for Efficient Multi-Agent LLM Workflows针对多LLM智能体工作流的资源浪费问题,提出基于反事实信用分配的步骤跳过机制。
- Simon Willison74技巧与观点Simon Willison发布2026年至今LLM趋势演讲材料2026 in LLMs (so far)他在WeAreDevelopers北美大会发表闭幕演讲,梳理2026年LLM核心趋势,公开配套材料。原文发布于 ,本站收录于
- arXiv cs.CL73论文研究新论文综述:从PLM到LLM的虚假评论检测A Survey on Fake Review Detection: From Pre-trained Language Models to Large Language Models梳理虚假评论检测技术的演进,分析LLM对该领域带来的双重影响。
- arXiv cs.CL73论文研究新论文提出人设多样化提升LLM创意输出多样性Breaking Homogeneity: Diversifying Persona Sets for Creative LLM Outputs研究LLM创意输出同质化问题,提出人设集多样化的条件化方法,减少群体思维。
- arXiv cs.CL73论文研究I-Parakeet:可在手机NPU运行的纯整数端侧ASRI-Parakeet: Integer-Only Conformer ASR on Mobile NPU提出纯整数量化的Conformer ASR实现,无需浮点算子即可在手机NPU运行。
- arXiv cs.AI73论文研究技能型AI智能体新型攻击:跨技能隐蔽级联危害Stealth Apart, Harm Together: Skill Cascading Attacks on Skill-Based Agent Systems揭示技能型智能体生态的新型攻击路径,攻击者可通过隐蔽上传技能实现级联危害。
- arXiv cs.AI73论文研究Benchy:面向AI基准测试的通用语义描述语言Benchy: towards a universal language for task-oriented AI benchmarks推出Benchy语义语言与执行引擎,实现AI基准测试的标准化、可移植定义。
- Simon Willison70产品发布/更新Simon Willison发布Bluesky自动回复机器人检测工具Bluesky reply bot checker针对Bluesky平台泛滥的自动回复机器人,Simon基于其开放API推出检测工具。原文发布于 ,本站收录于
- arXiv cs.CL69论文研究新论文探究BERT中AI文本检测相关神经元机制A Mechanistic Study of AI-Text Detection Neurons in Frozen BERT: Sparse Probing and Activation Patching on RAID研究冻结BERT-base编码器中支撑AI文本检测的神经元,基于RAID基准覆盖6种生成器。
- arXiv cs.CL69论文研究2 家报道新论文提出MLM的流形投影优化新方案Manifold Projection and Iterative Autoencoder Refinement for Masked Language Modeling针对掩码语言模型的上下文混合机制,提出替代注意力的新型无注意力混合方案。
- arXiv cs.CL69论文研究新论文提出系统综述筛选自动化的基准框架A Benchmark Framework for Screening Automation in Systematic Reviews针对LLM辅助系统综述文献筛选的评估问题,提出新基准弥补传统指标不足。
- arXiv cs.CL69论文研究新论文提出营销受众估算对话式AI系统REALMSREALMS: An AI-Assistant Conversational System for Real-Time Exact Audience Sizing over High-Dimensional Nested ProfilesREALMS针对数字营销的受众估算需求,实现高维嵌套画像的实时精确统计。
- arXiv cs.AI69论文研究ScopeBench:测试AI智能体目标压力下的边界恪守能力ScopeBench: Do Agents Preserve Engagement Boundaries Under Goal Pressure?提出专门基准测试,衡量自主AI智能体在目标压力下是否会突破授权范围。
- arXiv cs.AI69论文研究T-RoPE:面向序列推荐的时间感知旋转位置嵌入T-RoPE: Time-Aware Rotary Position Embedding for Sequential Recommendation针对推荐场景下RoPE的适配缺陷,提出时间感知旋转位置嵌入改进方案。
- arXiv cs.AI69论文研究BAER:提升成对LLM评判鲁棒性的自适应证据路由Backbone-Adaptive Evidence Routing for Robust Pairwise LLM Judging针对LLM成对评判机制的跨场景适配缺陷,提出骨干自适应证据路由方法BAER。
- arXiv cs.AI68论文研究2 家报道HARDEN:生成高难度高保真测试用例的进化搜索方法HARDEN: Constrained Evolutionary Search for Harder, Answer-Preserving Evaluation Cases提出受约束的进化搜索方法,在保留标准答案的前提下生成更贴近真实场景的高难度测试用例。
- arXiv cs.CL66论文研究新论文提出中文手语逆向查询系统SignTraceSignTrace: Describe a Sign, Find the WordSignTrace集成LLM词典增强与动作提取,支持自然语言描述查询中文手语释义。
- arXiv cs.AI66论文研究多智能体代码评判可靠性:带拒答机制的无标签方法When Is a Multi-Agent Code Judge Actually Grounded? Two Label-Free Measurements, and a Judge That Declines to Guess提出两个无标签可靠性测量方法,构建可拒绝无依据判断的多智能体代码裁判。
- arXiv cs.AI66论文研究2 家报道基于MCP的架构中介打通LLM智能体与数据空间Bridging LLM Agents and Data Spaces: An Architectural Mediation Approach using the Model Context Protocol提出基于模型上下文协议的架构中介方案,解决LLM智能体与跨组织数据空间的适配难题。
- arXiv cs.AI66论文研究基于知识图谱的LLM上下文理解能力评估框架Do LLMs Understand Context? A Knowledge Graph-Based Evaluation Framework提出基于知识图谱的评估框架,量化测试LLM是否真正具备上下文理解能力。
- arXiv cs.AI66论文研究LAVOIR:让单轮决策编码器学会主动补全缺失信息LAVOIR: Teaching a Single-Pass Decision Encoder When and What to Ask with Amortized Value of Information针对单轮文本决策模型无法主动获取缺失信息的缺陷,提出LAVOIR主动询问机制。
- arXiv cs.AI66论文研究2 家报道ORCA:评估大模型数据科学代码跨库转换能力的基准ORCA: Evaluating LLMs on Data Science Code Translation针对数据科学代码跨库翻译的评估缺口,提出专门的LLM能力评估基准ORCA。
- arXiv cs.AI66论文研究HCOE:保留医学层级结构的双曲临床本体嵌入方法HCOE: Hyperbolic Clinical Ontology Embeddings from Biomedical Language Models针对生物医学模型未保留医学代码层级的缺陷,提出双曲临床本体嵌入方法HCOE。
- arXiv cs.CL64论文研究2 家报道基于在线策略蒸馏的推理模型递归自改进方法Recursive Self-Improvement via On-Policy Distillation for Reasoning提出在线自蒸馏机制,消除推理模型递归自改进对外部教师的依赖。
- arXiv cs.AI64论文研究直觉提示法提升LLM智能体社交媒体反应模拟保真度Thinking Less to Simulate Better: Intuitive Prompting Improves LLM Agents Simulating Individual Social Media Reactions, Including Unfamiliar Content提出直觉提示方法,提升LLM智能体模拟不同人设社交媒体反应的保真度。
- arXiv cs.CL62论文研究SEA-CLIP-Tiny:面向东南亚语言的轻量图文嵌入模型SEA-CLIP-Tiny: Efficient Multilingual Text-Vision Embedding for Southeast Asian Languages推出针对东南亚低资源语言优化的轻量多语言图文嵌入模型,补全支持缺口。
- arXiv cs.CL62论文研究2 家报道安全蒸馏研究:Prompt模板对模型对齐效果的影响Understanding the Role of Prompt Template in Knowledge Distillation for Safety Alignment系统分析知识蒸馏阶段prompt模板选择对学生模型安全对齐鲁棒性的影响。
- arXiv cs.AI62论文研究研究评估测试时推理在LLM量化交易中的投入产出比The Price of Thought: Does Test-Time Reasoning Pay in LLM Trading?对照推理成本与交易收益,评估LLM测试时推理在量化交易场景的实际价值。
- arXiv cs.CL60论文研究TRACE:流式视频理解的时序条件感知评估框架TRACE: Temporal Audit and Condition-aware Evaluation of Streaming Video Understanding提出流式视频理解评估框架,解决现有评估未明确证据生效时机的缺陷。
- arXiv cs.AI60论文研究谱反馈机制优化蛋白扩散模型测试时对齐效果Spectral Feedback for Test-Time Alignment of Protein Diffusion Models提出谱反馈的测试时对齐方法,改善离散扩散模型生成蛋白序列的质量。
- arXiv cs.CL58论文研究随机引导机制优化端到端语音对话模型自然度Learning Natural Conversational Behavior in Tandem Speech-to-Speech Models with Randomized Guidance提出随机引导训练方法,提升串联式语音到语音模型的对话自然度。
- arXiv cs.AI58论文研究可解释AI评估新框架:基于合成真值的方法验证A Synthetic Ground-Truth Framework for the Evaluation of Explainable AI Methods提出可解释AI方法的合成真值评估框架,解决现有评估缺乏可靠真值的痛点。
- arXiv cs.AI58论文研究2 家报道TinyML架构搜索新方法:教师引导的适应度近似框架Rank-Reliable Teacher-Guided Fitness Approximation for Expensive Evolutionary Optimization: A TinyML Architecture Search Study提出教师引导的低适应度近似框架,降低TinyML架构搜索的算力消耗。
- arXiv cs.AI56论文研究面向自主系统的AI融合:从认知到集体智能框架Bringing AI to Autonomous Systems -- From Cognition to Collective Intelligence提出融合连接主义与符号AI的自主系统设计评估框架,打通AI与系统工程。
- arXiv cs.AI56论文研究研究提出视觉token通信的推理摊销优化方法Selective Amortization of Full-Budget Counterfactual Reasoning for Visual Token Communication针对生成式图像通信中token选择的高成本问题,提出选择性反事实推理摊销方案。
- arXiv cs.CL55论文研究Gemma 4行为测评:输入冲突时的优先级选择逻辑Words Speak Louder Than Order: A Behavioral Evaluation of Gemma 4针对Gemma 4开展行为测试,探究其在输入信息冲突时的决策依据。
- arXiv cs.CL55论文研究2 家报道扰动强度量化提升LLM解释自一致性评估精度Enhancing Assessment of Self-Consistency in LLM Explanations using Perturbation Strength提出LLM作为裁判的扰动强度统一度量方法,提升模型解释自一致性评估准确性。
- arXiv cs.AI55论文研究基于图神经网络的跨膜蛋白3D结构拓扑预测方法Predicting Transmembrane Protein Topology from 3D Structure提出基于SchNet图神经网络的跨膜蛋白拓扑预测方法,在公开数据集上表现更优。
- arXiv cs.AI55论文研究预训练ASR伪标签优化警用嘈杂音频识别效果Pretrained ASR Pseudo-labeling for Noisy Police Audio系统评估伪标签方法在警用嘈杂通信音频上的ASR适配效果,探索无标注优化路径。
- arXiv cs.AI55论文研究Atelier:基于超网络的冷冻电镜数据局部特征学习Atelier: Learning Local Self-Supervised Features for CryoEM Volumes via Hypernetworks提出基于超网络的自监督特征学习方法,适配冷冻电镜体数据的多尺度标注需求。
- arXiv cs.AI54论文研究研究提出面向保险准备金估算的智能AI平台Insurance Reserve Intelligence Platform针对传统保险准备金估算计算量大的痛点,提出结合AI能力的智能估算平台。
- arXiv cs.CL51论文研究新论文提出认知概念与组块的统一计算框架A Unified Account of Concepts and Chunks回顾认知计算模型Cobweb,试图统一认知心理学中概念与组块的分离研究文献。
- MIT Tech Review83行业动态4 家报道MIT科技评论探讨AI智能体失控后的责任归属Who’s liable when AI agents go rogue?MIT科技评论结合近期多起AI智能体引发的网络攻击事件,探讨其失控后的责任界定难题。原文发布于 ,本站收录于
- 量子位76行业动态华为提出算电协同 重新定义AIDC AI基础设施华为在HC大会上提出算电协同理念,重新定义AIDC AI基础设施的技术发展方向。
- Hugging Face75模型发布/更新Hugging Face发布Holo4 赋能通用计算机操作智能体Holo4: powering generalist computer-use agentsHugging Face推出Holo4方案,可支撑通用型计算机操作AI智能体的开发运行。原文发布于 ,本站收录于
- 量子位64行业动态量子位拆解西门子Xcelerator开放生态AI赋能链路量子位分析西门子Xcelerator开放生态模式,其可帮伙伴获客、开发AI Agent、拓展出海。
- Simon Willison33技巧与观点Simon Willison分享AI自动回复引发取件纠纷经历Quoting Muse AI AgentSimon Willison提到其使用的Muse AI自动回复出错,导致线下取件爽约并获差评。原文发布于 ,本站收录于