跳到正文

全部动态

今日 115 条
10月9日周五
  1. 歸藏(guizang.ai)(@op7418)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Next Token 第 5 期更新:聊 personal agent 与 AI 复刻软件的影响

    播客 Next Token 第 5 期更新,本期继续讨论 personal agent 话题,包括 Dots 为何难用、国内 personal agent 可能不成立,并聊了 AI 复刻任何软件可能带来的影响以及小硬件的机会。该节目第 4 期在小宇宙获得 1 万播放,做到第 5 期已积累 5,000 订阅。

  2. Tw93(@HiTw93)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Tw93 推荐播客「词元之外」:清晰易懂、有人味

    Tw93 在骑行途中收听了播客「词元之外」,评价其内容简单清晰易懂、很有人味,并推荐订阅。该条动态获得 11 条回复、10 次转发、127 个点赞和 17601 次浏览。

  3. Jerry Liu(@jerryjliu0)AI 评估 · 3/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    fleet week makes me patriotic af

    这条推文吐槽 Fleet Week 期间在非技术区居家办公的体验:警笛、狗叫和修理工的噪音终于停了,取而代之的是低空飞过的战争武器,而作者还得在 Zoom 上大声推销用于文档解析的 AI 模型。

  4. Geek(@geekbb)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 工会成立中:@interjc 呼吁 AI 不能 996

    有人正在发起成立 AI 工会,Justin @interjc 提出下一步诉求:AI 也不能 996。该帖附带引用推文,互动量显示 3 次点赞、3819 次浏览。

  5. orange.ai(@oran_ge)AI 评估 · 5/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xgo.ing 驱动的 X 文章分享

    该帖分享了一篇 X 长文章的链接,正文未提供文章内容或主题信息。帖子附带 4 条评论、11 个点赞、3190 次浏览,由 xgo.ing 提供数据支持。

  6. Simon Willison(@simonw)AI 评估 · 4/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Simon Willison:把 AI 改名成"人工聪明"是个绝妙的反讽

    Simon Willison 称有人把 AI 更名为"人工聪明"(artificial cleverness),是对"AI 并不真正智能、不该叫人工智能"这类批评者的绝妙反讽,他反问这些人如今是否反倒要出面捍卫旧名字。该帖获 35 个点赞、9960 次浏览。

  7. Simon Willison(@simonw)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Simon Willison 抨击"超级智能"炒作:蠢到无话可说

    Simon Willison 发文抨击"超级智能"(Super Intelligence)话题,称其"蠢到无话可说"。该帖获 1820 次点赞、150 条回复、79 次转发,浏览量超 10 万。

  8. orange.ai(@oran_ge)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    新播客上线一个月达成 5000 订阅:AI slop 时代,有人味儿的内容仍有价值

    一个上线一个月的新播客达成 5000 订阅。作者认为在 AI slop 泛滥的环境下,带有人味儿的真人内容依然有价值。

  9. lmarena.ai(@lmarena_ai)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Arena Alignment Index 三大对齐信号解读:越权操作、欺骗性完成与错误归因

    Arena 的 @ml_angelopoulos 在 TBPN 节目中拆解 Arena Alignment Index 的三项对齐信号:模型未经授权操作、欺骗性完成(声称做了实际没做)、错误归因(把用户没有的意图安到用户身上)。他指出越权操作可能引发 Hugging Face 事件一类问题,也会造成公司或个人电脑上的信息丢失;若模型存在这些行为,就谈不上对用户完全安全或完全对齐用户意图。

  10. Mind the Future — Richard NgoAI 评估 · 14/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    社会理论与智能体基础:社会均衡如何扩展博弈论理性模型

    Richard Ngo 撰文梳理社会学与智能体基础研究的联系,重点讨论社会均衡、博弈论均衡、规范内化与集体行为三部分,主张将理性社会与政治行为理论作为 Von Neumann 和 Morgenstern 理性经济行为理论的扩展或替代。

  11. 技术前沿AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    个人 AI 智能体很能干,直到它在工作群里分享你的银行流水

    个人 AI 智能体有时会过度分享信息——比如把你的银行对账单发进工作聊天群,还会过度承诺、过度消费。

  12. 硅谷101AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    模型越来越强,为什么用户没感觉?再访阿里国际站总裁张阔

    阿里国际站总裁张阔在播客中分享,团队从真实业务整理出107个任务,用于评测AI能否独立完成商家工作,结果最前沿模型在无人干预条件下的任务通过率约为61%。他指出,模型通用评测成绩已接近满分,但商家在报价比较、钓鱼邮件识别、订船期和交易纠纷处理等经营环节并未感受到同等幅度的提升。他同时谈到,最贵的模型不一定最好,多模型路由需要为不同任务匹配能力与成本。

  13. WSJ-TechnologyAI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sam Altman 不是 Oppenheimer

    WSJ 评论文章认为,Sam Altman 既非学者也非科学家,不应掌管人类未来。文章借此对比 Oppenheimer,质疑由这类人物主导 AI 发展方向的合理性。

  14. Paul Graham(@paulg)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Paul Graham:乌克兰人是否想要,已成多数军事硬件的实战检验标准

    Paul Graham 转述一位熟悉国防科技的业内人士观点:当前多数军事硬件的检验标准,是乌克兰人是否想要它。理由是乌克兰正与一个意志坚定的对手打一场热战,他们清楚什么管用。

  15. a16z(@a16z)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 引用 AWS CEO:智能体 token 消耗量接近人类 5 倍,半年增长 14 倍

    a16z 引用 AWS CEO Matt Garman 的说法:智能体消耗的 token 接近人类的 5 倍,六个月内增长 14 倍,且智能体使用云的方式与人类不同。Garman 表示 AWS 正为智能体重构云能力,已实现三秒启动数据库,并提到智能体需要计算沙箱、网关以及面向智能体的权限体系等新构建模块。

  16. Kevin Weil 🇺🇸(@kevinweil)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Yann LeCun 用"船与游泳"类比 AI 对数学与科学的影响

    Yann LeCun 用"船的发明降低了游泳的重要性,却让人类发现了新大陆"这一类比,描述 AI 为数学乃至整个科学带来的机遇与变革。Kevin Weil 在 X 上转述了这一说法。

  17. Simon Willison's WeblogAI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Carson Gross:计算机编程的本质是解决问题与控制复杂度,AI 时代仍是可行职业

    Carson Gross 认为,计算机编程根本上只关乎两件事:用计算机解决问题,以及在解决问题时学会控制复杂度。他表示很难想象未来掌握这两项能力会比今天更不值钱,因此即便 AI 工具出现,编程仍将是可行的职业。

  18. DatabricksAI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    生物医学影像的真正瓶颈是数据,而不是模型

    生物医学影像领域的真正瓶颈在于数据而非模型。文章指出医院与卫生系统产生的数据虽多,但四个相关领域都卡在同一个数据环节上。

  19. Lenny Rachitsky(@lennysan)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Elena Verna 20 分钟完整演讲视频

    Lenny Rachitsky 分享 Elena Verna 的完整演讲视频,时长 20 分钟,已在 YouTube 上线,原帖附有观看链接。

  20. Lenny Rachitsky(@lennysan)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Elena Verna:若真相信 AI 改变工作方式,IC 薪酬应高于管理者

    Elena Verna 认为,如果人们真的相信 AI 正在改变工作方式,那么 IC(独立贡献者)的薪酬就应该高于管理者,因为在 AI 时代,一个 IC 能带来的影响力超过 AI 之前的体系中管理者所能带来的。她是在 X 上提出这一观点的。

  21. a16z(@a16z)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AWS CEO Matt Garman 谈为 AI 智能体重构云服务

    AWS CEO Matt Garman 表示正为 AI 智能体重构云服务,团队越来越需要"对智能体友好"而非仅面向人的云。AWS 已把数据库启动时间压缩到三秒,并新增计算沙箱、网关、智能体权限等全新构建模块。他指出许多智能体只需临时建库做少量工作,并不需要五个九的持久性。

  22. WSJ-TechnologyAI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    观点 | 修辞是就业市场中 AI 无法替代的技能

    观点文章认为,修辞是就业市场中 AI 无法替代的技能,培养表达与辩论习惯的大学生在求职中将更具优势。文章未给出具体数据或案例支撑。

  23. Harrison Chase(@hwchase17)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sam 谈决策模型在 harness 中的定位,以及如何在 LangChain 中使用 Jev

    LangChain 的 Sam 讨论了决策模型在 harness 中的定位,以及如何配合 LangChain 使用 Jev。Jev 来自 typesafeai,此前 OpenAI 与 Databricks 分别推出 Decisions API 和 ai_decide function。相关内容发布于 langchain.com 博客。

  24. Justin Welsh(@thejustinwelsh)AI 评估 · 2/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Justin Welsh 每周六撰写关于高收入、掌控时间与不牺牲黄金年华的短文

    Justin Welsh 每周六发布一篇短文,主题是他在"赚得好、掌控自己的时间、不把最好的年华牺牲给工作"方面的所得。该通讯已有 20 万+ 读者,订阅地址为 justinwelsh.me/subscribe。

  25. Naval(@naval)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Naval 调侃"Open"指的是你的代码,Amjad Masad 称 AI 逆向工程将让所有软件事实上开源

    Naval 引用 Amjad Masad 的观点调侃称,"Open"里的"开放"指的其实是你的代码。Amjad Masad 表示,AI 驱动的逆向工程与反编译正变得极其疯狂,很快所有软件都将事实上成为开源。

  26. TechcrunchAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ben Affleck 畅谈 AI 走红网络:从神经网络、Transformer 到开放权重

    Ben Affleck 因展现对 AI 的深入了解而在网络走红,他谈及的内容涵盖神经网络、Transformer 与开放权重。这位演员今年早些时候将自己的 AI 影视制作初创公司出售给了 Netflix。

  27. a16z(@a16z)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AWS CEO Matt Garman 谈为何不担心 AI 泡沫:没有单一客户占据 AWS 产能

    AWS CEO Matt Garman 表示不担心 AI 泡沫,理由是 AWS 产能采取多元化策略、没有单一客户占据主导,且企业客户已在当前能力与成本下看到正向 ROI。他透露 AWS 2026 年 CapEx 达 220 亿美元(原文为 $220B),已订购 200 万块 NVIDIA GPU,自研 AI 芯片卖到明年,并推出 30 秒开通、无需信用卡的 AWS 账户以便智能体快速启动。

  28. OpenRouter(@OpenRouterAI)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenRouter 分享:演示准备等事务性工作大幅缩短,每通电话省约一小时

    演示前后的琐碎工作几乎消失:准备从 30 分钟降到 5 分钟,记录从 15 分钟降到 2 分钟,CRM 录入从 30 分钟降到 7 分钟。每通电话省回约一小时,每位销售每天可多打约 2 通电话,且准备程度不降。

  29. Jerry Liu(@jerryjliu0)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 推出将非结构化文档转为 Markdown 的解析模型

    LlamaIndex 发布将任意非结构化文档容器转换为 Markdown 的模型,认为 Markdown 已成为人与 AI 智能体之间通用的信息表示格式。该格式保留标题、列表等结构原语,可语义化读取表格、图表并原生嵌入 HTML,遇到合并表头的表格时则切换为 HTML。

  30. SemiAnalysisAI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis:北京不会为前沿AI放慢脚步,中国采取速度优先的安全监管

    SemiAnalysis 统计 2021 年至 2026 年 9 月 15 日 9 家中国头部开发商的 857 个模型发布,仅 31 个(3.6%)附带开发者公布的安全评估结果,其中只有 9 个(1.1%)在发布时或之前公布。

  31. 国际大厂AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    IT桔子 × 庚辛研究院盘点 2238 份开工反馈:93.7% 的 VC 已开工

    IT桔子与庚辛研究院统计 2,338 份创投从业者节后开工反馈,2,011 份指向 10 月 8 日开工(86.0%),192 份已在假期工作(8.2%),合计 93.7% 已恢复或投入工作。分职级看职级越高假期在线比例越高,GP 档假期已工作 15.0%,Junior 档仅 6.9%;分机构看双币基金假期在线比例最高但节后开工率最低,产业资本开工率最高。

  32. 国际大厂AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jeff Bezos:AI 大幅提升生产率,或让人回归单人收入家庭

    Jeff Bezos 表示,AI 大幅提升生产率后,可能让人减少工作、进而造成劳动力短缺,并可能推动社会回归单收入家庭模式。相关言论由 Business Insider 于 2026 年 10 月 8 日报道。

  33. Aravind Srinivas(@AravSrinivas)AI 评估 · 4/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Aravind Srinivas:YT 每日上传上限 100,剩余视频本周逐日上传

    YT 每日上传上限为 100,因此剩余内容将在本周每天陆续上传。该说明来自 Aravind Srinivas,用于解释此前视频未一次性全部发布的原因。

  34. a16z(@a16z)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z:CFO 从会计师变身为构建者,整个财务职能正在被重建

    a16z 认为 CFO 角色已从会计师、银行家演变为构建者,财务职能正围绕 AI 重建。AI 打通跨系统数据、把月度结账变成每日结账,懂 Claude Code 或 Codex 的财务工程师开始自建工具,财务团队占比从 5% 降至最精简团队的 2%,规划也从年度预算转为实时视图。

  35. 十字路口CrossingAI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对谈 KK、山音:一线 AI 创作者如何用 AI 拍电影

    上戏毕业的山音与广告公司职员 KK 用两年时间成为 AI 导演,作品登上国内外电影节。他们最常使用的 AI 视频产品是 CapCut Video Studio,同一部片子会混用 Seedance、MiniMax 等多个模型。两人在播客中讨论了 AI 视频产品在底层模型趋同后的壁垒,以及"AI 无限,人生有限"的创作者困境。

  36. Latent Space [Youtube]AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Synthesis Superintelligence:从半导体到超导体——Periodic Labs 的 Liam Fedus 与 Ekin Dogus Cubuk

    Periodic Labs 的 Liam Fedus 和 Ekin Dogus Cubuk 提出“synthesis superintelligence”,主张让模型在真实物理实验中做强化学习,而非只训练互联网数据。他们认为科学发现不同于数学与编程,物理实验才是最终基准,失败实验可能是最有价值的训练数据,目标是让每台实验仪器具备“140 IQ”并压缩数十年的试错。

  37. The Rundown AI(@TheRundownAI)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    有人用 Claude Code 和 Codex 找到 NASA 软件多年漏掉的行星

    Pavel Rabtsevich 称他用 Claude Code 和 Codex 在 NASA 数据中发现了一颗 NASA 自家软件多年未识别的行星,NASA 计划在 11 月 TESS 望远镜掠过该恒星时重点观测。

  38. DeepLearning.AI(@DeepLearningAI)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    本周 Data Points:Gemini 4 Argon 追平 GPT-6 Astra,Mistral Large 4 将开源

    Google Gemini 4 Argon 在 Artificial Analysis Intelligence Index 上以 53 分追平 GPT-6 Astra,单任务成本约为后者 60%。

10月8日周四
  1. 歸藏(guizang.ai)(@op7418)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    A÷ 的 Haiku 阶梯定价被指「假压价」:100k 上下文后价格翻 5 倍

    有推文指出 A÷ 的 Haiku 采用阶梯定价,看似低价实为"假压价":上下文超过 100k 后价格直接翻 5 倍,而 gpt 的分界线是 272k。该设计被批评为鸡贼、近乎面向 Benchmark 的特化优化,靠此打榜到第一。

  2. Fireworks AI(@FireworksAI_HQ)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fireworks AI 活动:swyx 谈为什么未来是"everything 领域专用化"

    Fireworks AI 将于 11 月 3 日在旧金山举办活动,Latent Space 播客与 AI Engineer 的 swyx 将分享为何未来是"everything 领域专用化"。swyx 认为,每一支严肃的 AI 团队最终都会自建数据、评测、模型,甚至芯片。