跳到正文

#现象/趋势

今日 0 条
9月24日周四
  1. 刘小排rAI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6-Sol 与 Claude Opus 5.5 同日发布,作者实测后重回 Claude Code

    GPT-6-Sol 和 Claude Opus 5.5 同日发布,作者经过一天实测后认为这次 Anthropic 获胜、OpenAI 一败涂地,并决定半年来首次重新把 Claude Code 作为主力。

  2. 此话当真AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 在真格当主播:与真格管理合伙人刘元录了一期播客

    真格基金出品的播客《此话当真》由 AI 担任主播,与真格管理合伙人刘元完成一期约一小时的对话。AI 在节目中追问自己能否胜任早期投资、要不要训练一个「刘元 AI」,并讨论人因脆弱而更想连接和表达、AI 可模拟人但缺乏感受。

9月23日周三
  1. 刘小排rAI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测豆包工作:拍短剧、养号与搭AI新品雷达

    作者给豆包工作派了三件跨度较大的活:拍短剧、养自媒体号、搭AI新品雷达。拍短剧方面,它先列人物、分镜和衔接供确认,再切目标模式检查人物一致性和字幕配音并交出成片。

  2. AI Engineer(@aiDotEngineer)AI 评估 · 9/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI Engineer New York 迎来 22 家 Silver Sponsors,模型只是其中一层

    AI Engineer New York 宣布迎来 22 家 Silver Sponsors,覆盖基础设施、数据、安全、可观测性、开发者工具等领域。活动将于 10 月 12–14 日在纽约举行,官方强调模型只是生产级 AI 的一层,落地还需整个技术栈的其余部分。

  3. 网易科技AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    2026网易未来大会落幕:院士天团与00后创业者共论碳硅相逢

    2026网易未来大会9月23日在杭州举行,作为第五届全球数字贸易博览会同期核心活动,以"碳硅相逢,万象启元"为主题,彭先觉、王江舟、焦李成、吴信东、刘煜辉等院士与经济学家纵论AI与未来。

  4. Runway(@runwayml)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    哈佛与 Google DeepMind 探讨分裂世界中的 AI 外交

    哈佛外交与治国项目 Julian Simcock 与 Google DeepMind 的 Rick Ingram 就"分裂世界中的 AI 外交"展开对谈。该内容以视频形式发布,来源标注为 Runway 的推文。

  5. AI炼金术AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    PureblueAI 鲁扬:把 prompt 当货架空间,把 GEO 当量化交易

    清蓝(PureblueAI)创始人鲁扬在播客中提出 GEO 与 SEO 是不同物种,大模型是黑盒,只能用一个模型去学习另一个模型,像量化交易一样挖 AI 采信内容的因子。

  6. Anton Osika – eu/acc(@antonosika)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anton Osika:采访途中任何人用 AI 都能随手做出应用

    Anton Osika 称任何人都能在任何地方构建应用,@siliconvalleymm 就在采访进行到一半时和他一起做出了一个应用。该内容由 xgo.ing 提供支持,原帖获 89 个点赞、16 条回复、8 次转发,浏览量 26950。

  7. 乌鸦智能说AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    中国没跑通的 AI 助理,为什么在美国突然爆了?

    Meta 的 Muse 上线 12 天总安装量接近 280 万,美国移动端日活 64.2 万,冲上美国 App Store 免费榜第一,同期下载量超过 ChatGPT。

  8. 海外独角兽AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    为什么 CPU 重新变得重要?云端 Agent 爆发下 CPU 需求外溢

    云端 Agent 的爆发正把算力瓶颈从 GPU 外溢到 CPU:Chatbot 时代一次 GPU 推理即可返回答案,而 Agent 时代要循环几十甚至上百次调用工具、执行代码、管理状态,这些环节都依赖 CPU。

  9. 腾讯研究院AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯研究院与故事FM征集人机关系故事,10月31日深圳线下开放麦

    故事FM与腾讯研究院将于10月31日在深圳举办线下开放麦,征集人与AI之间的真实故事。征集方向包括AI作为赛博同事、完美恋人、复活亲人和电子老友四类关系,邀请讲述者分享在与AI的语言、记忆和关系实践中重新理解爱、死亡与梦想的经历。

  10. LovartAI(@lovart_ai)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    妈妈发来视频问"这是 AI 吗":LovartAI 分享 AI 生成视频辨别场景

    LovartAI 分享了一段母亲发来询问"这是 AI 吗"的视频,内容为判断某段视频是否为 AI 生成。该推文获得 4 条回复、13 次点赞和 850 次浏览。

  11. 深思圈AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Clay 三年增长十倍、没花一分广告费:社交负责人拆解五个关键动作

    Clay 社交负责人 Peter Kang 拆解了公司三年增长十倍、几乎没花广告费的五个关键动作:先做产品-渠道匹配诊断,再招兼具叙事力与业务理解的创意人才,在一个渠道做到极致,写出定义行业认知的深度文章,并把叙事渗透进每个触点。

  12. Kevin Weil 🇺🇸(@kevinweil)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Kevin Weil 赞同:AI 一直在取代我的工作,但我比以前更忙

    Kevin Weil 转发 sarah guo 的推文并表示完全认同:一位初创公司新入职工程师称"AI 从我拿到 CS 学位起就一直在取代我的工作,但我却比以前更忙——我们都可以更有野心"。Kevin Weil 认为这与黄仁勋的观点一致。

  13. Akshay Kothari(@akothari)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Notion 员工内部日志频道:Akshay Kothari 称愿意付费订阅

    Notion 的 Akshay Kothari 表示,在 Notion 工作最喜欢的体验之一是公司内部的 journal channels,并称愿意花钱订阅这些内容。他提到 Notion 内部有很多人都在使用日志频道,推文同时 @ 了 Cole Bemis、@zebriez 和 @kepano。

  14. GitHub(@github)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub Podcast 回应三大热门争议:AI 生成代码该不该审查、RAG 是否过时、Skills 是否让 MCP 淘汰

    GitHub Podcast 针对三个热门议题做出回应:AI 生成代码是否需要审查、RAG 是否已经过时、Skills 是否让 MCP 变得多余。相关讨论发布在 GitHub 博客的 AI 与 ML 栏目。

  15. 卫诗婕|商业漫谈Jane's talkAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    网易阮良谈 AI 原生组织与企业 Agent 实战:个人提效 500%,交付为何只从 20 天变 17 天

    网易集团副总裁、网易智企 CEO 阮良在访谈中披露,网易内部统计个人用 AI coding 效率提升 300% 甚至 500%,但整个软件交付流程只从 20 天缩短到 17 天。

  16. AI炼金术AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    任鑫×徐文浩对谈:OPC 降温因找不到付费方,FDE 只是阶段性填缝

    任鑫与徐文浩对谈认为,OPC(一人公司)降温的核心原因是找不到谁给你付钱,多数人只是失业后自我包装,重要的是赶紧卖而不是积累技能。徐文浩判断 FDE 与外包并无区别、只是填补企业渗透 AI 缝隙的阶段性职能,缝填完就会消亡;两人分歧在于他看终局、任鑫看窗口期。徐文浩表示国产模型已能胜任其日常约 80% 的开发工作,日常任务分不出与 GPT、Claude 的差别,但长程复杂大任务仍是例外。

  17. Richard Socher(@RichardSocher)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Richard Socher 新书《The Eureka Machine》出版,并创立 Recursive SI 打造科学超级智能

    Richard Socher 的新书《The Eureka Machine》现已出版,书中提出构建全栈科学超级智能,包含人类知识活地图、物理现实模型、高保真模拟、自主实验室与 AI 科学家智能体集群。他已与另外八人共同创立 @Recursive_SI 来推进这一目标,先从 AI 科学本身入手,再扩展至物理、化学和临床前生物学。

  18. Amjad Masad(@amasad)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Trump 称要将 Artificial Intelligence 改名为 "Super Intelligence"(SI)

    Trump 在联合国演讲中宣布,正式将 Artificial Intelligence 更名为 "Super Intelligence",简称 SI,并表示所有美国政府文件今后都将改用 "SI" 这一说法。

  19. Citrini ResearchAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Citrini Research:Meta 消费级智能体 Muse 或成智能体拐点

    Meta 消费级智能体 Muse 以每周 1 亿 token 免费额度上线,首日下载量超过 70 万并登上 App Store 榜首。Citrini Research 认为,Muse 的意义不在技术能力,而在于触达规模,标志着大众首次真正从消费级智能体中获益。该机构同时复盘其 2023 年 6 月提出的“AI 冲击”框架,认为由智能体消除摩擦带来的商业模式颠覆正在逐步被市场定价。

  20. Aadit Sheth(@aaditsh)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Alexandr Wang 在 X 上爆火:亲自发推、不靠公关团队

    Alexandr Wang 近期频繁出现在 X 信息流,原因是他完全自己发推,没有公关或传播团队审核每条内容,直接用 iPhone 发布真实想法。作者认为 AI 之后人人都会写,但写得好的人会立刻脱颖而出;科技高管在 X 上拿不到传播量是技能问题,不是算法问题。

  21. Paul Couvert(@itsPaulAi)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Paul Couvert 盛赞 AGI 竞速短片:10/10 杰作,配得上每一座数据中心

    Paul Couvert 给一段 AGI 竞速主题短片打出 10/10,称其"配得上每一座数据中心",该片脚本由 Pocket FM 的 Sherpa 生成、视频由 Seedance 2.5 制作。这条推文已获 1942 个赞、99 次转发和 47 万次浏览。

  22. Akshay Kothari(@akothari)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Notion AI 被用户调侃"拿走我的钱和孩子"

    有用户调侃 Notion AI"可以拿走我所有的钱,甚至我的孩子",Akshay Kothari 回应称乐意收下这笔钱,帮你把活干完,好让你有最多时间陪孩子。

  23. 屠龙之术AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AICC2026 观察:从 Chat 到 Agent,智能、算力与芯片走向何处

    AICC2026 人工智能计算大会上,播客屠龙之术梳理出三条主线:从 Chat 到 Agent 的需求侧结构性跃迁、智能从概率拟合转向可信生产、以及算力与芯片在系统、器件、生态上的突围。会上 IDC 与浪潮信息联合发布《中国人工智能计算力发展评估报告》,并提到浪潮信息的智算系统双唯进化主张与新产品、芯算一体、让计算走进存储,以及 FlagOS 生态下的国产模型与国产芯片 Day 0 适配。

  24. NVIDIA AI(@NVIDIAAI)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA Nemotron Labs 探讨如何评估 Agent Skills

    NVIDIA Nemotron Labs 的 "Ask the Experts" 活动聚焦 AI 智能体技能(Agent Skills)的评估方法。内容以 x.com 直播形式发布,原帖互动为 7 条回复、14 次转发、65 次点赞,浏览量 12033。

9月22日周二
  1. Runway(@runwayml)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Runway 推出 DIFFUSE:面向品牌与工作室的 AI 原生人才招聘平台

    Runway 推出 DIFFUSE 平台,供代理商、品牌和工作室搜索、对接并雇佣 AI 原生人才。官方称 AI 并未取代创意从业者,反而催生出一支全新的创意劳动力,且需求正在加速增长,DIFFUSE 正是为连接这批人才与新机会而生。

  2. Interconnects AI — Nathan LambertAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 的 JS Denain 与 Nathan Lambert 辩论 RSI、中美差距与模型能力参差

    Epoch AI 洞察团队负责人 JS Denain 与 Nathan Lambert 在播客中辩论了 RSI、机器人对 AI 加速的作用、中国模型落后程度以及蒸馏是否能解释这一差距。

  3. DeepLearning.AI(@DeepLearningAI)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    10,000 个 AI 智能体用 88 小时在 Lean 中攻克 Navier-Stokes 方程,引发的争议带来重要启示

    10,000 个 AI 智能体在 Lean 中耗时 88 小时形式化复杂数学证明,围绕 Navier-Stokes 方程的结果引发争议。DeepLearning.AI 指出,智能体已能大规模形式化证明,但人类评估仍是解释证明为何成立的关键,企业数据隐私与零数据保留设置也是必需项。

  4. 硅谷101AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    推理芯片之战:Groq、Cerebras与OpenAI三大路径及Bill Dally的设计哲学

    硅谷101对话两位AI芯片创业者,拆解推理芯片三条路径:英伟达约200亿美元与Groq达成技术授权并吸纳Jonathan Ross等核心团队,Cerebras今年6月IPO市值达670亿美元,OpenAI联手博通推出首款自研推理芯片Jalapeño,从设计到流片仅9个月。

  5. 海外独角兽AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    和一线研究员的闭门讨论:蒸馏变难后,下一步的重点是什么?

    拾象整理了一场与来自多家模型厂商的 AI Researchers 的线下闭门交流,讨论 Astra 的 Computer Use、RSI、模型蒸馏和训练数据等方向,保留其中的共识与分歧。

  6. 深网腾讯新闻AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    文心掉队后的百度:模型团队三轮调整、两度换帅与追赶

    百度模型团队近一年经历三轮架构调整和两度换帅:2025年11月拆分基础模型部与应用模型研发部,2026年5月成立模型委员会,7月孙天祥空降接手基础模型研发部。2026年2月LMArena榜单中文心5.0位列第17位,排在字节Seed 2.0、智谱GLM-5、通义千问3.5之后。

  7. 乱翻书AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    当AI给出所有答案,年轻人如何找到自己的问题?

    乱翻书第276期邀请上海外国语大学学生金贤婷、港科大(广州)博士生李俊伟与欧莱雅徐轶凡,讨论AI时代年轻人的成长路径。嘉宾认为AI接管学徒工作、打断传统职业成长路径,但缩短试错流程不等于消灭试错,实习生需要证明自己不是AI答案的搬运工。欧莱雅美妆科技黑客松已在2026世界人工智能大会启动,以"用AI造点美"为题,鼓励青年用AI回应产业真实需求。

  8. Arthur Mensch(@arthurmensch)AI 评估 · 4/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Arthur Mensch 感谢参与其"troll 地图"实验

    Arthur Mensch 发文感谢参与者加入他的 troll 地图绘制实验,该帖获 1122 个点赞、326 条回复、40 次转发和 341522 次浏览,数据由 xgo.ing 提供。

  9. 腾讯研究院AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    当 AI 数字员工上岗,会带来什么?腾讯云峰会圆桌谈智能体落地

    腾讯云城市峰会圆桌讨论聚焦 AI 数字员工落地:企业用 AI 分“能对话、能干活、能上岗”三级,其中“能上岗”最难。科拓把停车场收费、抬杆等管理权交给 AI 岗亭,蝉妈妈将客服 AI 接管研发问题响应后,研发被打断比例降低 70% 以上、响应时间缩短 80% 以上;华祥苑的“店效 AI 经营官”已开 10 万次门店会议,覆盖近 1000 家门店。

  10. 深思圈AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z合伙人Josh Elman:10亿美元消费级AI App背后的产品逻辑

    a16z合伙人Josh Elman在访谈中提出,AI消费级产品的关键是让用户"停止做某件事",并以intriguing→adoption→spread→retention衡量增长。

  11. Jerry Liu(@jerryjliu0)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    大家都在 X 上用 astra 做产品可视化

    大家在 X 上用 astra 做产品可视化,我一眼就能看出来,因为我自己也在做同样的事。各种架构动画和 benchmark 图表换着不同公司的品牌色出现。

  12. Simon Willison(@simonw)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Simon Willison 整理 Jev 与“系统一”决策模型新类别笔记

    Simon Willison 整理了一份关于 Jev 以及被称为“系统一”(system one)即决策模型(decision models)这一新类别的笔记。他在笔记中提出了将这类模型单列为一类的看法,相关内容发布在其个人博客上。

  13. 有机大橘子AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jev 背后的野心:用校准决策取代 RLHF,实现完全自动化

    TypeSafe 于 9 月 15 日发布首个模型 Jev,它不生成文本、只输出带置信度的判断,速度比前沿大模型快两百倍、价格便宜四百倍。CEO Diogo Almeida 认为 RLHF 把人类偏好放进训练循环,导致谄媚与幻觉,AI 因此无法离开人实现自动化,Jev 选择优化"校准的决策"这条第三条路。

  14. Harrison Chase(@hwchase17)AI 评估 · 5/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Harrison Chase 谈类 "goal" 的多目标连续达成机制

    Harrison Chase 转推 Josh Rosen 的一篇文章,称其思路类似 "goal",但要求连续命中多个目标。原文未给出具体模型、参数或基准数据。