每日时间线 · 9月28日 · 北京时间 UTC+8

2026-09-28 的 AI 热点

当天共 76 条,其中 35 条 70 分以上。按本站收录时间排列,晚发布的来源也会算进当天。点标题看详情,X 推文直接打开原帖。

  1. 量子位70行业动态清华系量子AI团队估值10亿,改造大模型底层清华背景量子AI创业团队获10亿估值,用量子技术优化大模型底层架构
  2. 量子位70产品发布/更新3 家报道桌面级量子计算小盒子发布,端到端跑通数据不出门桌面量子计算设备已跑通端到端流程,数据无需外传,降低开发者使用门槛
  3. 量子位70模型发布/更新匿名玉兔模型登顶OpenRouter双榜,Coding能力优异玉兔模型登顶OpenRouter双榜,中秋稳坐日榜首,编程实测表现突出原文发布于 ,本站收录于
  4. TechCrunch AI83行业动态Anthropic CEO将与特朗普首次一对一共进晚餐Anthropic’s CEO is about to have dinner with President TrumpAnthropic首席执行官Dario Amodei即将与特朗普共进晚餐,此为双方首次一对一单独会面。
  5. The Verge AI74行业动态2 家报道OpenAI智能体被曝高频扫描联合国网站超1.6万次OpenAI agents tried to ‘bruteforce’ a UN website安全研究员发现OpenAI智能体4-6月扫描联合国贸发会议网站超1.6万次,凸显AI智能体安全风险。原文发布于 ,本站收录于
  6. The Verge AI67产品发布/更新Thoughtful Things推出AI音乐采样器Engram并开启众筹Engram is a sampler that turns broken AI hallucinations into music该AI采样器可将AI幻觉生成的音频转为音色,并非一键生成歌曲设备,正开启众筹。
  7. TechCrunch AI52行业动态媒体讨论Meta AI产品Muse能否破解其信任难题Can Muse overcome Meta’s trust issues?Equity播客讨论Meta的AI公告抢占OpenAI、Anthropic风头的现象及Muse前景。
  8. 量子位42行业动态4 家报道量子位称存在可致OpenAI最强模型训练崩溃的题目该资讯未披露具体题目及技术细节,仅提及存在可致OpenAI最强模型训练崩溃的题目。原文发布于 ,本站收录于
  9. TechCrunch AI28行业动态Anthropic CEO Amodei被《周六夜现场》恶搞Anthropic’s Dario Amodei gets the SNL treatment美国综艺《周六夜现场》推出恶搞Amodei的桥段,调侃其为AI的"造魔者"。原文发布于 ,本站收录于
  10. arXiv cs.AI35论文研究2 家报道提出面向机器感质的S3Q意识理论五层实现架构From S3Q Theory to Implementation: Towards an Architecture for Machine Qualia针对机器意识研究的理论落地难题,提出S3Q意识理论的五层计算实现架构
  11. arXiv cs.CL82论文研究新论文审计生产Text-to-SQL中LLM评委失效问题Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline实测生产环境中gpt-4o-mini作为LLM评委与人工标注一致性极低,提出修复方案。
  12. arXiv cs.CL82论文研究2 家报道新论文提出AI智能体联邦工具发现框架CartographCartograph: Federated Tool Discovery with Operator-Attested Retrieval for AI Agents针对MCP协议下工具目录过大的问题,提出联邦代理将遍历复杂度从O(n)降至O(k)。
  13. arXiv cs.CL82论文研究2 家报道新论文提出LLM智能体记忆诊断框架MemProbeProbing Stability-Plasticity Tradeoffs in Agent Memory through Cognitive Experimental Paradigms受认知科学启发,提出MemProbe框架,诊断LLM Agent记忆的稳定性与可塑性平衡。
  14. arXiv cs.CL82论文研究3 家报道新论文提出Web智能体知识综合能力新基准The Hard Part Comes After Search: Benchmarking Web Agents on Synthesizing, Organizing, and Displaying Knowledge现有Web Agent基准未覆盖知识综合能力,新基准评估该类复杂工作流表现。
  15. arXiv cs.AI82论文研究研究提出LLM智能体执行控制失效问题及优化架构LLM Parkinsonism: Executive-Control Failure, Token-Inefficient Persistence, and an Uncertainty-Aware Global Executive Control Architecture for Autonomous Language-Model Agents发现LLM智能体存在目标达成后冗余操作的控制缺陷,提出不确定性感知架构。
  16. arXiv cs.CL80论文研究Spotify分享对话推荐智能体自提升优化方案Bootstrapping Conversational Recommendation Agents At Spotify: Synthetic Data Generation and Self-Improvement LoopsSpotify提出对话推荐智能体的优化方案,通过合成数据与自提升循环优化规划能力。
  17. arXiv cs.CL80论文研究新论文探究医疗LLM答案检索式评估失效原因Where Does Retrieval-Based Open-Ended Evaluation Fail? Automatic Taxonomy Induction from Long-Form Medical Answer Factuality Verification分析医疗场景下检索式事实校验评估的失效模式,提出自动分类体系归纳方法。
  18. arXiv cs.CL80论文研究新论文提出生产级AI智能体评估框架CARGOCARGO: Context-Aware Retrieval-Gated Evaluation of Agentic AI in Production针对生产级智能体动态实体的评估问题,提出上下文感知的检索门控框架避免误判。
  19. arXiv cs.CL77论文研究新论文提出ASR推理时目标说话人遗忘机制Inference-Time Target Speaker Unlearning in LLM-Based Automatic Speech Recognition提出TSU-ASR任务,可在推理时让多说话人ASR系统跳过指定退出用户的语音转录。
  20. arXiv cs.CL77论文研究新论文发现语码转换训练可实现小模型跨语言对齐Feeding BabyLMs Macaroni: Code-Switching Curricula Cause Cross-Lingual Convergence实验发现用混合语码文本训练小型Transformer,可诱导跨语言对齐效果。
  21. arXiv cs.CL77论文研究KV缓存新淘汰策略:多样性感知分层打分机制Beyond Mean Attention: Diversity-Aware, Layer-Wise Scoring for KV Cache Eviction提出融合注意力离散度、冗余度的KV缓存打分方法,提升淘汰效率。
  22. arXiv cs.CL75论文研究2 家报道新论文提出LLM智能体分层协作记忆检索框架Not All Memories Are Equal: Hierarchical Collaborative Memory for Validity-Aware Retrieval in LLM Agents针对团队协作场景下LLM智能体的异构记忆,提出分层有效性感知的检索机制。
  23. arXiv cs.CL75论文研究新论文提出无训练多智能体幻灯片生成框架SlideLabSlideLab: Audience-Centered Scientific Slide Generation and EvaluationSlideLab是无训练多智能体框架,可从研究论文自动生成面向受众的科学演示幻灯片。
  24. arXiv cs.CL75论文研究2 家报道新论文提出LLM因果感知同传语音翻译框架All In Good Time: Causality-Aware Framework for LLM-Based Simultaneous Speech-to-Speech Translation针对LLM同传语音翻译的因果对齐数据缺失问题,提出因果感知的新框架。
  25. arXiv cs.CL75论文研究2 家报道新论文提出语音智能体可靠性评估协议Inquesto ScoreInquesto Score: A reliability Protocol For Voice Agents提出可复现、可解释的语音智能体可靠性评估协议,通过版本化测试集统计成功率。
  26. arXiv cs.AI75论文研究BioEVAL:全球多机构联合推出的生物工程大模型基准BioEVAL: A global, multi-institutional benchmark of large language and multimodal models for bioengineering联合全球多机构推出面向生物工程领域的LLM与多模态模型评测基准,覆盖前沿任务。
  27. arXiv cs.AI75论文研究新研究:音频LLM可识别自身转录失效场景Audio LLMs Know When They Can't Hear You针对音频LLM在退化音频下的转录错误问题,提出模型转录可靠性评估框架。
  28. arXiv cs.AI75论文研究CRC-Router:面向医疗AI智能体的风险约束路由机制CRC-Router: Risk-Constrained Routing for Medical Agentic AI Systems针对医疗AI Agent自主决策的安全风险,提出风险约束路由方案降低临床隐患。
  29. arXiv cs.AI75论文研究研究分析编码AI智能体的成本低效行为及缓解方案Analyzing and Mitigating Cost-Inefficient Behaviors in Coding Agents基于1200条代码Agent运行轨迹,梳理其成本过高的核心行为问题并给出缓解思路。
  30. arXiv cs.AI75论文研究2 家报道研究提出多LLM智能体工作流的低耗步骤跳过方案Learning What to Skip: Counterfactual Credit Assignment for Efficient Multi-Agent LLM Workflows针对多LLM智能体工作流的资源浪费问题,提出基于反事实信用分配的步骤跳过机制。
  31. Simon Willison74技巧与观点Simon Willison发布2026年至今LLM趋势演讲材料2026 in LLMs (so far)他在WeAreDevelopers北美大会发表闭幕演讲,梳理2026年LLM核心趋势,公开配套材料。原文发布于 ,本站收录于
  32. arXiv cs.CL73论文研究新论文综述:从PLM到LLM的虚假评论检测A Survey on Fake Review Detection: From Pre-trained Language Models to Large Language Models梳理虚假评论检测技术的演进,分析LLM对该领域带来的双重影响。
  33. arXiv cs.CL73论文研究新论文提出人设多样化提升LLM创意输出多样性Breaking Homogeneity: Diversifying Persona Sets for Creative LLM Outputs研究LLM创意输出同质化问题,提出人设集多样化的条件化方法,减少群体思维。
  34. arXiv cs.CL73论文研究I-Parakeet:可在手机NPU运行的纯整数端侧ASRI-Parakeet: Integer-Only Conformer ASR on Mobile NPU提出纯整数量化的Conformer ASR实现,无需浮点算子即可在手机NPU运行。
  35. arXiv cs.AI73论文研究技能型AI智能体新型攻击:跨技能隐蔽级联危害Stealth Apart, Harm Together: Skill Cascading Attacks on Skill-Based Agent Systems揭示技能型智能体生态的新型攻击路径,攻击者可通过隐蔽上传技能实现级联危害。
  36. arXiv cs.AI73论文研究Benchy:面向AI基准测试的通用语义描述语言Benchy: towards a universal language for task-oriented AI benchmarks推出Benchy语义语言与执行引擎,实现AI基准测试的标准化、可移植定义。
  37. Simon Willison70产品发布/更新Simon Willison发布Bluesky自动回复机器人检测工具Bluesky reply bot checker针对Bluesky平台泛滥的自动回复机器人,Simon基于其开放API推出检测工具。原文发布于 ,本站收录于
  38. arXiv cs.CL69论文研究新论文探究BERT中AI文本检测相关神经元机制A Mechanistic Study of AI-Text Detection Neurons in Frozen BERT: Sparse Probing and Activation Patching on RAID研究冻结BERT-base编码器中支撑AI文本检测的神经元,基于RAID基准覆盖6种生成器。
  39. arXiv cs.CL69论文研究2 家报道新论文提出MLM的流形投影优化新方案Manifold Projection and Iterative Autoencoder Refinement for Masked Language Modeling针对掩码语言模型的上下文混合机制,提出替代注意力的新型无注意力混合方案。
  40. arXiv cs.CL69论文研究新论文提出系统综述筛选自动化的基准框架A Benchmark Framework for Screening Automation in Systematic Reviews针对LLM辅助系统综述文献筛选的评估问题,提出新基准弥补传统指标不足。
  41. arXiv cs.CL69论文研究新论文提出营销受众估算对话式AI系统REALMSREALMS: An AI-Assistant Conversational System for Real-Time Exact Audience Sizing over High-Dimensional Nested ProfilesREALMS针对数字营销的受众估算需求,实现高维嵌套画像的实时精确统计。
  42. arXiv cs.AI69论文研究ScopeBench:测试AI智能体目标压力下的边界恪守能力ScopeBench: Do Agents Preserve Engagement Boundaries Under Goal Pressure?提出专门基准测试,衡量自主AI智能体在目标压力下是否会突破授权范围。
  43. arXiv cs.AI69论文研究T-RoPE:面向序列推荐的时间感知旋转位置嵌入T-RoPE: Time-Aware Rotary Position Embedding for Sequential Recommendation针对推荐场景下RoPE的适配缺陷,提出时间感知旋转位置嵌入改进方案。
  44. arXiv cs.AI69论文研究BAER:提升成对LLM评判鲁棒性的自适应证据路由Backbone-Adaptive Evidence Routing for Robust Pairwise LLM Judging针对LLM成对评判机制的跨场景适配缺陷,提出骨干自适应证据路由方法BAER。
  45. arXiv cs.AI68论文研究2 家报道HARDEN:生成高难度高保真测试用例的进化搜索方法HARDEN: Constrained Evolutionary Search for Harder, Answer-Preserving Evaluation Cases提出受约束的进化搜索方法,在保留标准答案的前提下生成更贴近真实场景的高难度测试用例。
  46. arXiv cs.CL66论文研究新论文提出中文手语逆向查询系统SignTraceSignTrace: Describe a Sign, Find the WordSignTrace集成LLM词典增强与动作提取,支持自然语言描述查询中文手语释义。
  47. arXiv cs.AI66论文研究多智能体代码评判可靠性:带拒答机制的无标签方法When Is a Multi-Agent Code Judge Actually Grounded? Two Label-Free Measurements, and a Judge That Declines to Guess提出两个无标签可靠性测量方法,构建可拒绝无依据判断的多智能体代码裁判。
  48. arXiv cs.AI66论文研究2 家报道基于MCP的架构中介打通LLM智能体与数据空间Bridging LLM Agents and Data Spaces: An Architectural Mediation Approach using the Model Context Protocol提出基于模型上下文协议的架构中介方案,解决LLM智能体与跨组织数据空间的适配难题。
  49. arXiv cs.AI66论文研究基于知识图谱的LLM上下文理解能力评估框架Do LLMs Understand Context? A Knowledge Graph-Based Evaluation Framework提出基于知识图谱的评估框架,量化测试LLM是否真正具备上下文理解能力。
  50. arXiv cs.AI66论文研究LAVOIR:让单轮决策编码器学会主动补全缺失信息LAVOIR: Teaching a Single-Pass Decision Encoder When and What to Ask with Amortized Value of Information针对单轮文本决策模型无法主动获取缺失信息的缺陷,提出LAVOIR主动询问机制。
  51. arXiv cs.AI66论文研究2 家报道ORCA:评估大模型数据科学代码跨库转换能力的基准ORCA: Evaluating LLMs on Data Science Code Translation针对数据科学代码跨库翻译的评估缺口,提出专门的LLM能力评估基准ORCA。
  52. arXiv cs.AI66论文研究HCOE:保留医学层级结构的双曲临床本体嵌入方法HCOE: Hyperbolic Clinical Ontology Embeddings from Biomedical Language Models针对生物医学模型未保留医学代码层级的缺陷,提出双曲临床本体嵌入方法HCOE。
  53. arXiv cs.CL64论文研究2 家报道基于在线策略蒸馏的推理模型递归自改进方法Recursive Self-Improvement via On-Policy Distillation for Reasoning提出在线自蒸馏机制,消除推理模型递归自改进对外部教师的依赖。
  54. arXiv cs.AI64论文研究直觉提示法提升LLM智能体社交媒体反应模拟保真度Thinking Less to Simulate Better: Intuitive Prompting Improves LLM Agents Simulating Individual Social Media Reactions, Including Unfamiliar Content提出直觉提示方法,提升LLM智能体模拟不同人设社交媒体反应的保真度。
  55. arXiv cs.CL62论文研究SEA-CLIP-Tiny:面向东南亚语言的轻量图文嵌入模型SEA-CLIP-Tiny: Efficient Multilingual Text-Vision Embedding for Southeast Asian Languages推出针对东南亚低资源语言优化的轻量多语言图文嵌入模型,补全支持缺口。
  56. arXiv cs.CL62论文研究2 家报道安全蒸馏研究:Prompt模板对模型对齐效果的影响Understanding the Role of Prompt Template in Knowledge Distillation for Safety Alignment系统分析知识蒸馏阶段prompt模板选择对学生模型安全对齐鲁棒性的影响。
  57. arXiv cs.AI62论文研究研究评估测试时推理在LLM量化交易中的投入产出比The Price of Thought: Does Test-Time Reasoning Pay in LLM Trading?对照推理成本与交易收益,评估LLM测试时推理在量化交易场景的实际价值。
  58. arXiv cs.CL60论文研究TRACE:流式视频理解的时序条件感知评估框架TRACE: Temporal Audit and Condition-aware Evaluation of Streaming Video Understanding提出流式视频理解评估框架,解决现有评估未明确证据生效时机的缺陷。
  59. arXiv cs.AI60论文研究谱反馈机制优化蛋白扩散模型测试时对齐效果Spectral Feedback for Test-Time Alignment of Protein Diffusion Models提出谱反馈的测试时对齐方法,改善离散扩散模型生成蛋白序列的质量。
  60. arXiv cs.CL58论文研究随机引导机制优化端到端语音对话模型自然度Learning Natural Conversational Behavior in Tandem Speech-to-Speech Models with Randomized Guidance提出随机引导训练方法,提升串联式语音到语音模型的对话自然度。
  61. arXiv cs.AI58论文研究可解释AI评估新框架:基于合成真值的方法验证A Synthetic Ground-Truth Framework for the Evaluation of Explainable AI Methods提出可解释AI方法的合成真值评估框架,解决现有评估缺乏可靠真值的痛点。
  62. arXiv cs.AI58论文研究2 家报道TinyML架构搜索新方法:教师引导的适应度近似框架Rank-Reliable Teacher-Guided Fitness Approximation for Expensive Evolutionary Optimization: A TinyML Architecture Search Study提出教师引导的低适应度近似框架,降低TinyML架构搜索的算力消耗。
  63. arXiv cs.AI56论文研究面向自主系统的AI融合:从认知到集体智能框架Bringing AI to Autonomous Systems -- From Cognition to Collective Intelligence提出融合连接主义与符号AI的自主系统设计评估框架,打通AI与系统工程。
  64. arXiv cs.AI56论文研究研究提出视觉token通信的推理摊销优化方法Selective Amortization of Full-Budget Counterfactual Reasoning for Visual Token Communication针对生成式图像通信中token选择的高成本问题,提出选择性反事实推理摊销方案。
  65. arXiv cs.CL55论文研究Gemma 4行为测评:输入冲突时的优先级选择逻辑Words Speak Louder Than Order: A Behavioral Evaluation of Gemma 4针对Gemma 4开展行为测试,探究其在输入信息冲突时的决策依据。
  66. arXiv cs.CL55论文研究2 家报道扰动强度量化提升LLM解释自一致性评估精度Enhancing Assessment of Self-Consistency in LLM Explanations using Perturbation Strength提出LLM作为裁判的扰动强度统一度量方法,提升模型解释自一致性评估准确性。
  67. arXiv cs.AI55论文研究基于图神经网络的跨膜蛋白3D结构拓扑预测方法Predicting Transmembrane Protein Topology from 3D Structure提出基于SchNet图神经网络的跨膜蛋白拓扑预测方法,在公开数据集上表现更优。
  68. arXiv cs.AI55论文研究预训练ASR伪标签优化警用嘈杂音频识别效果Pretrained ASR Pseudo-labeling for Noisy Police Audio系统评估伪标签方法在警用嘈杂通信音频上的ASR适配效果,探索无标注优化路径。
  69. arXiv cs.AI55论文研究Atelier:基于超网络的冷冻电镜数据局部特征学习Atelier: Learning Local Self-Supervised Features for CryoEM Volumes via Hypernetworks提出基于超网络的自监督特征学习方法,适配冷冻电镜体数据的多尺度标注需求。
  70. arXiv cs.AI54论文研究研究提出面向保险准备金估算的智能AI平台Insurance Reserve Intelligence Platform针对传统保险准备金估算计算量大的痛点,提出结合AI能力的智能估算平台。
  71. arXiv cs.CL51论文研究新论文提出认知概念与组块的统一计算框架A Unified Account of Concepts and Chunks回顾认知计算模型Cobweb,试图统一认知心理学中概念与组块的分离研究文献。
  72. MIT Tech Review83行业动态4 家报道MIT科技评论探讨AI智能体失控后的责任归属Who’s liable when AI agents go rogue?MIT科技评论结合近期多起AI智能体引发的网络攻击事件,探讨其失控后的责任界定难题。原文发布于 ,本站收录于
  73. 量子位76行业动态华为提出算电协同 重新定义AIDC AI基础设施华为在HC大会上提出算电协同理念,重新定义AIDC AI基础设施的技术发展方向。
  74. Hugging Face75模型发布/更新Hugging Face发布Holo4 赋能通用计算机操作智能体Holo4: powering generalist computer-use agentsHugging Face推出Holo4方案,可支撑通用型计算机操作AI智能体的开发运行。原文发布于 ,本站收录于
  75. 量子位64行业动态量子位拆解西门子Xcelerator开放生态AI赋能链路量子位分析西门子Xcelerator开放生态模式,其可帮伙伴获客、开发AI Agent、拓展出海。
  76. Simon Willison33技巧与观点Simon Willison分享AI自动回复引发取件纠纷经历Quoting Muse AI AgentSimon Willison提到其使用的Muse AI自动回复出错,导致线下取件爽约并获差评。原文发布于 ,本站收录于
返回 AI 热点