AI 日报 · 9月28日

今日AI:Anthropic CEO将与特朗普首次单独会面

今日AI领域动态密集:Anthropic首席执行官将与特朗普迎来首次一对一单独会面;OpenAI智能体被曝数月内高频扫描联合国网站超1.6万次,暴露智能体安全风险;同时清华系量子AI团队获10亿估值,多篇聚焦LLM智能体、端侧技术的前沿研究成果集中发布。

产品发布/更新

1 条
  1. 01OpenAI智能体被曝高频扫描联合国网站超1.6万次OpenAI agents tried to ‘bruteforce’ a UN website2026年9月29日Meta Muse智能体被曝未经授权抓取用户18.7万行私信数据提醒用户使用AI智能体时注意隐私风险防护。882 家报道The Verge AI 等 · 3 条

行业动态

2 条
  1. 01Anthropic CEO将与特朗普首次一对一共进晚餐Anthropic’s CEO is about to have dinner with President Trump经知情信源确认,Anthropic CEO将当周周末赴白宫与特朗普首次一对一会面头部AI企业掌舵人与美高层会面,可关注后续AI政策动向。83TechCrunch AI · 2 条
  2. 02清华系量子AI团队估值10亿,改造大模型底层清华背景量子AI创业团队获10亿估值,用量子技术优化大模型底层架构为关注量子+AI赛道的读者提供前沿创业动态参考70量子位

论文研究

19 条
  1. 01新论文提出Web智能体知识综合能力新基准The Hard Part Comes After Search: Benchmarking Web Agents on Synthesizing, Organizing, and Displaying Knowledge2026年9月28日多团队发布5款覆盖多垂直场景的AI评估基准并配套公开工具。更全面地评估Web Agent的实用能力,引导技术优化方向。1003 家报道量子位 等 · 5 条
  2. 02新论文提出AI智能体联邦工具发现框架CartographCartograph: Federated Tool Discovery with Operator-Attested Retrieval for AI Agents2026年9月28日HF收录多跳推理潜回路相关AI研究论文。大幅提升AI Agent大规模工具目录下的检索效率,降低开销。922 家报道arXiv cs.CL 等 · 4 条
  3. 03新论文提出LLM因果感知同传语音翻译框架All In Good Time: Causality-Aware Framework for LLM-Based Simultaneous Speech-to-Speech Translation2026年9月28日HF Daily Papers发布时序大模型PaCTS方法提升低资源场景下LLM同传语音翻译的性能与保真度。852 家报道arXiv cs.CL 等 · 4 条
  4. 04研究提出多LLM智能体工作流的低耗步骤跳过方案Learning What to Skip: Counterfactual Credit Assignment for Efficient Multi-Agent LLM Workflows2026年9月28日HF收录研究提出角色感知Transformer量化新方案帮助企业优化多Agent LLM工作流的运行效率与投入成本。852 家报道arXiv cs.AI 等 · 4 条
  5. 05新论文审计生产Text-to-SQL中LLM评委失效问题Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline2026年9月28日arXiv公开两项大模型落地优化相关预印本研究提醒从业者重视LLM评委的实际可靠性,规避生产风险。82arXiv cs.CL 等 · 2 条
  6. 06Spotify分享对话推荐智能体自提升优化方案Bootstrapping Conversational Recommendation Agents At Spotify: Synthetic Data Generation and Self-Improvement LoopsSpotify提出对话推荐智能体的优化方案,通过合成数据与自提升循环优化规划能力。为工业界对话推荐系统的落地提供可参考的实战经验。80arXiv cs.CL
  7. 07新论文探究医疗LLM答案检索式评估失效原因Where Does Retrieval-Based Open-Ended Evaluation Fail? Automatic Taxonomy Induction from Long-Form Medical Answer Factuality Verification2026年9月28日arXiv cs.CL上线两项NLP领域的前沿AI相关研究成果提升医疗高风险场景下LLM生成内容的事实校验可靠性。80arXiv cs.CL · 2 条
  8. 08新论文提出生产级AI智能体评估框架CARGOCARGO: Context-Aware Retrieval-Gated Evaluation of Agentic AI in Production4款适配多场景的AI评测框架在arXiv公开预印本研究成果为生产级AI Agent的效果评估提供更准确的解决方案。80arXiv cs.CL 等 · 4 条
  9. 09新论文提出ASR推理时目标说话人遗忘机制Inference-Time Target Speaker Unlearning in LLM-Based Automatic Speech Recognition提出TSU-ASR任务,可在推理时让多说话人ASR系统跳过指定退出用户的语音转录。满足用户的语音隐私需求,提升ASR系统的合规性。77arXiv cs.CL
  10. 10新论文发现语码转换训练可实现小模型跨语言对齐Feeding BabyLMs Macaroni: Code-Switching Curricula Cause Cross-Lingual Convergence实验发现用混合语码文本训练小型Transformer,可诱导跨语言对齐效果。为小模型多语言能力训练提供低成本的新方案。77arXiv cs.CL
  11. 11KV缓存新淘汰策略:多样性感知分层打分机制Beyond Mean Attention: Diversity-Aware, Layer-Wise Scoring for KV Cache Eviction提出融合注意力离散度、冗余度的KV缓存打分方法,提升淘汰效率。可降低大模型长文本推理的显存占用,加快推理速度。77arXiv cs.CL
  12. 12新论文提出无训练多智能体幻灯片生成框架SlideLabSlideLab: Audience-Centered Scientific Slide Generation and EvaluationSlideLab是无训练多智能体框架,可从研究论文自动生成面向受众的科学演示幻灯片。科研人员可参考该框架快速从论文生成演示文稿,节省工作量。75arXiv cs.CL
  13. 13BioEVAL:全球多机构联合推出的生物工程大模型基准BioEVAL: A global, multi-institutional benchmark of large language and multimodal models for bioengineering2026年9月28日arXiv上线3项AI评测领域相关学术成果帮助行业客观衡量大模型在生物工程场景的实际应用能力。75arXiv cs.AI 等 · 3 条
  14. 14新研究:音频LLM可识别自身转录失效场景Audio LLMs Know When They Can't Hear You针对音频LLM在退化音频下的转录错误问题,提出模型转录可靠性评估框架。助力开发者提升语音交互类AI产品的输出稳定性与可靠性。75arXiv cs.AI
  15. 15CRC-Router:面向医疗AI智能体的风险约束路由机制CRC-Router: Risk-Constrained Routing for Medical Agentic AI Systems针对医疗AI Agent自主决策的安全风险,提出风险约束路由方案降低临床隐患。为医疗场景AI Agent的安全落地提供可参考的风险控制框架。75arXiv cs.AI
  16. 16研究分析编码AI智能体的成本低效行为及缓解方案Analyzing and Mitigating Cost-Inefficient Behaviors in Coding Agents基于1200条代码Agent运行轨迹,梳理其成本过高的核心行为问题并给出缓解思路。帮助开发者降低日常使用编码Agent的运行成本。75arXiv cs.AI
  17. 17新论文提出人设多样化提升LLM创意输出多样性Breaking Homogeneity: Diversifying Persona Sets for Creative LLM Outputs研究LLM创意输出同质化问题,提出人设集多样化的条件化方法,减少群体思维。帮助开发者解决LLM创意输出同质化的痛点,提升内容质量。73arXiv cs.CL
  18. 18I-Parakeet:可在手机NPU运行的纯整数端侧ASRI-Parakeet: Integer-Only Conformer ASR on Mobile NPU提出纯整数量化的Conformer ASR实现,无需浮点算子即可在手机NPU运行。为端侧离线语音识别应用提供更高效的部署参考方案。73arXiv cs.CL
  19. 19技能型AI智能体新型攻击:跨技能隐蔽级联危害Stealth Apart, Harm Together: Skill Cascading Attacks on Skill-Based Agent Systems揭示技能型智能体生态的新型攻击路径,攻击者可通过隐蔽上传技能实现级联危害。帮助智能体平台开发者识别新安全风险,加固技能审核机制。73arXiv cs.AI

技巧与观点

1 条
  1. 01Simon Willison发布Bluesky自动回复机器人检测工具Bluesky reply bot checkerSimon Willison提及所用Muse AI自动回复出错致线下取件爽约获差评帮助开发者快速掌握2026年LLM行业核心动向,节省整理时间。74Simon Willison · 4 条 · X 讨论 1

快讯

4 条
看当天完整时间线返回今日热点