跳到正文

#现象/趋势

今日 0 条
10月2日周五
  1. Guillermo Rauch(@rauchg)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Guillermo Rauch:未来属于验证工程,证明、e2e 测试、基准与 linter 将并存

    Guillermo Rauch 提出"验证工程"将成为未来方向,手段包括证明、e2e 测试、benchmark 和 linter,其中部分测试是确定性的,部分由 AI 智能体驱动。

  2. Claude(@claudeai)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude 应用推出两周用量减免,配合 Claude Sonnet 5.5 生成设计与演示稿

    Claude 官方宣布,为期两周内在 Claude 应用里开始设计稿、演示文稿或文档,该对话后续工作只消耗 50% 的用量额度。官方建议配合 Claude Sonnet 5.5 使用,称其对设计有较强的把握,生成的幻灯片几乎无需再编辑。

  3. Runway(@runwayml)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gamma、Adobe、Salesforce 高管谈创意 AI 从实验走向生产的变化

    Gamma 首席 AI 官 Deeni Fatiha、Adobe 总监 Morgan Prygrocki 与 Salesforce 全球品牌营销的 Shane Tapp 共同讨论了创意 AI 从实验阶段进入生产阶段后带来的变化。

  4. Justine Moore(@venturetwins)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    为吐槽数据中心的人做了支音乐视频(用了 @boneGPT 的 Slopcannon)

    作者用 @boneGPT 的 Slopcannon 制作了一支音乐视频,主题是回应那些不停发帖抱怨数据中心的人,并在 Twitter 上分享。

  5. DeepLearning.AI(@DeepLearningAI)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Andrew Ng 的 AI Engineering 技能图谱:该学什么,AI Dev 大会听一线构建者怎么说

    Andrew Ng 发布 AI Engineering Skills Map,梳理 AI 工程该学什么。AI Dev 大会将于 11 月 30 日至 12 月 1 日在纽约举行,Andrew Ng 与 Yann LeCun 将发表主题演讲,来自 Hugging Face、Google DeepMind 和 BlackRock 的工程师参与分享,早鸟票 599 美元。

10月1日周四
  1. Philipp Schmid(@_philschmid)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Philipp Schmid:首次见到人类用量不限、智能体用量受限

    Philipp Schmid 表示首次见到"人类使用不限量、智能体(agent)使用受限"的产品设定,并称这一现象很有意思。

  2. DatawhaleAI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    特朗普签署《开启超级智能时代》行政令,要求美国政府官方用语以 SI 取代 AI

    特朗普昨日签署《开启超级智能时代》行政令,要求美国联邦行政部门在法律允许范围内,将官方通信、网站、报告等非法定文件中的“人工智能”和“AI”替换为“超级智能”和“SI”,旧法规与历史文件不需修改。

  3. Lenny Rachitsky(@lennysan)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claire Vo:我们现在可以把所有糟糕的想法都发布了,恭喜!

    Claire Vo 在 X 上发帖称"我们现在可以把所有糟糕的想法都发布了,恭喜!",这条帖子获得 297 个点赞、24 条回复和 15 次转发,浏览量约 2.7 万。

  4. Stack Overflow BlogAI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stack Overflow 开发者调查回顾:AI 工具使用率三年从 44% 升至 79%

    Stack Overflow 回顾历年开发者调查数据,AI 工具使用率从 2023 年的 44% 升至 2024 年 62%、2025 年 79%,近半数受访者每天使用。

  5. Geek(@geekbb)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    坏了一根 16G 内存后,我用 Qwen3.8-Max 修了一天 PVE

    三台 PVE 同时挂了两台,作者称用 Qwen3.8-Max 修了一天,感觉其表现强于 Grok-4.7 和 DeepSeek-V4.1-Flash,目前一台已修好,并因此对 Qwen3.8 刮目相看。

  6. Yann LeCun(@ylecun)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Yann LeCun 发问:AI 放大人类智能,你支持还是反对智能?

    Yann LeCun 公开提问:"你是支持智能还是反对智能?"他认为 AI 像搜索引擎、图书馆、教育和语言一样放大人类智能,让人类更聪明、更有能力,并称希望智能被少数公司或政府控制的人是"新蒙昧主义者或新封建主义者"。

  7. AI炼金术AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    挣钱时都是超级个体,坐牢时把锅甩给 AI

    美国财长贝森特就 Hugging Face 事件表态,称这是 OpenAI 管理层的责任而非一群 agent 的责任,政府不会给 AI 实验室免责豁免。徐文浩与任鑫在播客中讨论了 agent 出事谁背锅、大公司 AI native 转型为何被拖慢、小公司借此少交「责任分配税」的机会,以及 Jev 模型引发的「工程与算法间的严重产能过剩」现象。

  8. AI产品黄叔(@PMbackttfuture)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    dot 打电话体验可替代 chat 通话,用户讨论 grokbot 多 bot 迁移

    有用户实测给 dot 打电话,认为可以完美替代此前在 chat 里打电话的需求。社群有朋友提出可把 grokbot 迁移过来,但该用户感觉两者不一样,并认为多 bot 形态更容易接受,例如 grokbot 里有视频号提取 bot、视频号批量提取 bot、邮箱 bot、微信 bot 等多个专用 bot。

  9. CSDNAI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    黄仁勋、马斯克与 Anthropic 联创 Tom Brown 同台:太空发电、硬件熔断与代码不再值钱

    在华盛顿一场科技圆桌论坛上,马斯克称美国平均用电负荷约 500 GW,每新增 5 GW 基荷电力约拉动 1% GDP(约 3000 亿美元),并主张把算力送上太空,SpaceX 计划与特斯拉联手实现每年 200 GW 太阳能组件产能。

  10. Justine Moore(@venturetwins)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Opus 5.5、Gemini 2.5 Flash、SAM 3.1 与 Ideogram 4.5 搭出一支工程团队的活

    有人用 Opus 5.5、Gemini 2.5 Flash、SAM 3.1 和 Ideogram 4.5 组成一套技术栈,分别负责界面、照片分类、图像分割和编辑,全部通过一个 fal API key 跑通,并称过去这需要一整支工程团队才能完成。

  11. Guillermo Rauch(@rauchg)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vercel AI Gateway:拒绝"免费 token"推广,做全球 AI token 流向的可信数据源

    Vercel AI Gateway 称其是全球 AI token 流向最大的可信数据源,因为它掌握真实客户在规模化平台上的真实用量,且零加价,平台已有 40 万+付费客户和数千家企业。

  12. 晚点LatePostAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    晚点 AI 季报:Meta Muse 与 OpenAI Dots 引爆个人助理,GPT-6 Astra 展现物理 AI 潜力

    OpenAI 在 DevDay 发布个人助手 Dots,Meta 的 Muse 则于 9 月 8 日上线并在 16 天内突破 340 万下载,引爆个人助理热潮。OpenAI 的 GPT-6 Astra 在 OSWorld 2.0 上从 65% 升至 72%,任务耗时缩短 47%。OpenAI 的 ARR 在 1 个半月内从超 400 亿美元涨至近 700 亿美元,涨幅约 70%。

  13. 深思圈AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Instinct 创始人 Noah Shinn:Personal Agent 正在重写互联网

    Instinct 是一个没有 App 的 AI 个人助理,通过短信、电话、邮件替用户订机票、管订阅、规划行程,创始人 Noah Shinn 称产品每天增长约 10%,平台年交易额已超十亿美元。它采用免费模式,在用户完成交易时从商家侧收取 take rate,其中 50% 交易额来自旅行;用户入驻满三周后有 40% 会主动分享信用卡信息,留存率随之跳到 80%。

  14. orange.ai(@oran_ge)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    两年前感到虚无的大聪明,如今成了我见过最充实的人

    两年前大聪明说自己感到一种虚无感,这两年却成了我见过最充实的人。战胜虚无的第一步是勇敢地面对它,如今越来越多人也开始感到虚无,我请大聪明分享过来人的经验。

  15. orange.ai(@oran_ge)AI 评估 · 5/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    orange.ai 分享 x.com 文章链接

    orange.ai(@oran_ge)在 X 上发布了一条指向 x.com 文章的链接,附带互动数据:3 条回复、7 次转发、54 次点赞、33051 次浏览。

  16. 有机大橘子AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    播客对谈:RSI 时代人类的命运与意义,从战锤、群星聊到湿件与俺寻思之力

    播客「有机大橘子」与赛博禅心主理人大聪明对谈 RSI 时代人类的命运与意义,提出人类始终有力量与意义两条腿,而当生产力集中在超级智能手中,围绕 AI 的人的意义却是缺失的,人越久待 AI 越易感到虚无。对谈借战锤、群星、四国演义、俺寻思之力与蒸发的尺子五个故事展开,称评价 AI 时代好坏的尺子已经蒸发。给普通人的建议是认清自己是普通人,以及快乐生活、保持健康,并把贬值快的换成贬值慢的。

  17. Epoch AIAI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 推出 ChatGPT 使用情况浏览器:基于 YouGov 5,000 名美国用户数据

    Epoch AI 发布 ChatGPT 使用情况浏览器,基于 YouGov 提供的 5,000 名美国 ChatGPT 用户聊天元数据,覆盖约 830 万条消息、66 万次对话,部分记录可追溯至 2022 年 11 月 ChatGPT 上线后数周。

  18. Latent.Space(@latentspacepod)AI 评估 · 5/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Latent.Space 的 AI newsletter 获用户好评

    有用户推荐 Latent.Space 的 newsletter,称其长期寻找真正能为 AI 话题带来价值的内容,而这一份"非常非常好"。该推文由 Aleix Prat 发布,互动数据为 4 次点赞、1626 次查看。

  19. 大模型智能AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 神秘 RL 后训练算法被指只是 STE 近似:解析 Score Centering 与 vLLM/Megatron 训推不一致问题

    针对 arXiv 论文《Score Centering Stabilizes Off Policy Reinforcement Learning》被传为 OpenAI 后训练 RL 算法,有分析指出该 score centering 算法本质上是 STE(straight through estimation)的近似实现,其梯度与 STE 方案完全一致。

9月30日周三
  1. Lenny Rachitsky(@lennysan)AI 评估 · 9/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 助手争相挖掘 Google 数据,Google 却缺席?

    Lenny Rachitsky 发问:还有比你的 Google 数据更有价值的数据集吗?他指出每个 AI 助手都在"吞食"这些数据并做出奇妙的事,而 Google 在这一领域却不见踪影。该帖获得 119 条回复、16 次转发和 592 个点赞,浏览量达 116059。

  2. Aadit Sheth(@aaditsh)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 将重写整个旅游行业:机票酒店都将由 AI 代订

    AI 将重写整个旅游行业,机票、酒店和旅行体验都将由 AI 完成预订,未来用户不必再自己办理航班值机。这一过程会通过 Instinct、Chat、Claude 等聊天工具完成,并越来越多地发生在 iMessage 或 WhatsApp 里。

  3. AI Engineer(@aiDotEngineer)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI Engineer New York:Towards AI 联合创始人兼 CTO 基准测试 148 个模型复刻个人文风

    Towards AI 联合创始人兼 CTO 将在 AI Engineer New York 分享:因不满 AI 生成的流水线内容,他基准测试了 148 个模型,寻找能模仿自己文风的模型,并发现衡量"品味"必须依赖人工评分。活动时间为 10 月 12 日至 14 日。

  4. Stack Overflow BlogAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stack Overflow 开发者调查:AI 工具使用率从 2023 年 44% 升至 2025 年 79%

    Stack Overflow 回顾 2024 与 2025 开发者调查数据:AI 工具使用率从 2023 年的 44% 升至 2024 年 62%、2025 年 79%,近半数受访者每天使用。

  5. 晚点LatePostAI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从编程到个人助理:更强大的 AI,更透明的你

    晚点LatePost 梳理了 AI 编程工具与个人助理带来的数据隐私风险:智谱 ZCode 因代码库索引功能默认打包上传项目数据致歉并删除数据、补偿 Token,xAI 的 Grok Build 也曾上传约 5.48GB 项目文件且未脱敏。

  6. idoubi(@idoubicc)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Your SaaS 应该有一个 agent skill

    Jonathan Wilke 提出,SaaS 产品应该配备一个 agent skill,而非只提供 MCP server。该观点以引用推文形式发布,未披露具体实现方式或支持的产品。

  7. Founder ParkAI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Instinct 创始人对谈:没有 App 的 Personal Agent 如何做到年化 10 亿美元交易额

    Instinct 创始人 Noah Shinn 在 Patrick O'Shaughnessy 播客上首次以长访谈形式介绍这款没有 App 的个人助理,用户通过短信、电话和邮件与它交互,它也能主动打电话提醒急事。

  8. 网易科技AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    三位00后创业者坦白局:技术、组织、死亡谷,和第一单白酒

    在2026网易未来大会上,灵初智能陈源培、OriginFlow秦深涛、万格智元王冠博三位00后创业者对话,谈具身智能落地瓶颈从算法转向算法工程化,创业公司真正的"死亡谷"在50到150人之间,端侧AI可用4G内存推理35B模型、10G内存推理80B模型。

  9. orange.ai(@oran_ge)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    花 1 美金 token 做的小软件,比很多专业骑行软件还好用

    有人花 1 美金 token 做了一个骑行小软件,自称比很多专业骑行软件都做得好,现在每次骑车都会用它。作者借国庆假期建议大家多多运动、少看 AI。

  10. 深网腾讯新闻AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    前京东智驾老兵刘东的星源智:只做具身智能“大脑”,已合作70%以上头部机器人公司

    星源智创始人刘东(前京东智能驾驶负责人)选择只做具身智能“大脑”不做本体,产品包括具身“大脑”模型与端侧算力平台,成立两个月后即开始交付,目前已与70%以上的头部机器人公司建立合作,预计今年实现数亿元收入。

  11. Z PotentialsAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    外滩大会AI2C论坛全纪实:从入口到交易,AI正在重写消费的每一个环节

    2026外滩大会·AI2C论坛在上海举行,12位创业者与投资人围绕AI如何从消费入口走向交易展开讨论。影眸科技Hyper3D现场演示Rodin 2.5,4秒生成基础3D模型、80秒生成千万级面数高精度资产,并已为劳氏3万多个SKU重建3D资产、将单件建模成本从100美金压到1美金以下。下半场焦点转向Agent代理搜索与支付,FluxA提出支付需感知用户意图、进入Agent执行上下文。

  12. 经纬创投AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    全民进入“纯过日子时代”,中秋、十一的生意变天了

    消费心态从“买体面”转向“纯过日子”,2025年末全国住户存款余额167万亿元、同比增长9.71%,居民定期存款占比升至73.4%,去年居民贷款仅新增4417亿元。可选消费收缩,8月金银珠宝类零售同比大跌17.5%,上半年高端餐饮关店率超65%;出游34.63亿人次、服务消费增速5.3%则继续扩张。

  13. 深思圈AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 深度对话:personal agent 的正确打开方式是什么

    a16z General Partner Anish Acharya 与 Assistant Benchmark 创始人 David Pawlan 在播客中讨论 personal AI agent:David 追踪到 122 个同类产品并亲自测试 26 个,他认为 proactivity(主动性)才是真正的护城河,而非功能多少或底层模型。

  14. Suhail(@Suhail)AI 评估 · 9/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Suhail:希望 AI 任何地方的进步都带来好日子而非被颠覆

    Suhail 表示,他这次非常在意一件事:无论 AI 的进步来自哪里,都应让多数日子变成好日子,而不是难熬的日子,也就是自己不被颠覆。他把今天视作对这一判断的一次不错的检验,并认为结果仍然成立。

  15. Akshay Kothari(@akothari)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Akshay Kothari 称赞 Tibo 团队对生态的投入,并看好 ChatGPT 插件发现带来的开放生态机会

    Akshay Kothari 称赞 Tibo 及其团队真正在意生态,是优秀的合作伙伴,始终想着把蛋糕做大。Tibo 认为 ChatGPT 上的插件发现带来巨大的采用机会,开放生态终将胜出。

  16. orange.ai(@oran_ge)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT 6.1 Sol 发布:缓存降价 50%,Anthropic 以安全为由未放 Astra

    OpenAI 发布 GPT 6.1 Sol,缓存价格下降 50%,但能力仍不及 Anthropic。Sonnet 5.5 跑分已超过 Astra,而 GPT 6.1 Astra 因安全原因未发布,Anthropic 由此稳居第一,并点名批评 GLM 5.3「跑太快、不够安全」。