跳到正文

#行业动态

今日 113 条
10月9日周五
  1. a16z(@a16z)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    德州为何让数据中心排队:a16z 谈电网接入与自建电源

    德州电网排队的大型新增客户容量从 2024 年底的 63 GW 升至今年 6 月的 474 GW,超过历史峰值需求五倍多,德州随即按下暂停键。开发商常跨多个站点重复提交申请、许多项目尚无客户,规划方难以分辨真伪,且大型数据中心完全接入电网需 5 到 10 年,于是不少开发商计划自建现场电源。

  2. a16z(@a16z)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    德州冻结数据中心新许可:排队量18个月从63 GW涨到474 GW

    德州冻结数据中心新增许可,其排队容量在18个月内从63 GW升至474 GW,超过历史峰值需求的5倍。其中仅9.5 GW获批,实际运行约4.3 GW,其余多为重复申请、投机性申请以及从未真正接入GPU的开发者。a16z的@rmcentush撰文解释电网为何无法按这么多不确定需求来建设,链接为a16z.news/p/why-texas-is…。

  3. a16z(@a16z)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    德州电网一年仅约200小时吃紧:a16z 称灵活数据中心可跳过扩容排队,为美国电网新增 100 GW

    德州电网每年只有约 200 小时达到满载,约占全年 2% 的时间。a16z 的 Ryan McEntush 指出,愿意在用电高峰削减负荷的新建数据中心可以跳过等待新增发电容量,从而更快接入电网。按此方式,美国电网可在不新建任何电厂的情况下增加 100 GW 的数据中心负荷。

  4. a16z(@a16z)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 投资 Preference Model:开源 RL 环境框架 Karotte

    a16z 宣布投资 Preference Model,该团队专注为头部实验室构建 AI 研究与 ML 工程方向的 RL 环境。本周他们开源了生产环境框架 Karotte,经超一百万次评估运行和红队测试打磨。团队重点在于让环境随模型变强而更难被攻破:定位模型弱点的工具、针对缺口生成新任务,并让智能体主动攻击测试环境。

  5. a16z(@a16z)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美国电网今年计划新增 86 GW,AI 实验室却规划数百 GW 电力

    美国电网今年计划新增 86 GW 装机,其中太阳能 43.4 GW、电池 24.3 GW、风电 11.8 GW、天然气 6.3 GW,新增核电为 0 GW。AI 实验室则在规划数百 GW 级电力,太阳能是唯一已具备该规模产能的电源,且大部分产能位于中国。a16z 的 @rmcentush 指出,扩展现有核电机组只能挤出少量增量,真正的空间在新反应堆。

  6. 创业邦AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小鹏集团Robotaxi定名小鹏悠游;报告称日本汽车软件落后海外5年,本田、丰田、日产均评最差等级

    小鹏集团Robotaxi正式定名为“小鹏悠游”,英文名XPENG YOYO。美国市场调查公司Mobility Global的“SDV成熟度”数据显示,截至2026年8月,沃尔沃、特斯拉、蔚来并列最高的5级,本田、丰田、日产均为最差的1级。理想、小鹏、小米、宝马为4级,吉利、比亚迪为3级。

  7. 创业邦AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯WorkBuddy上线“独立文件浏览器”;蔡崇信:五年后AI将如今天的互联网,融入社会的每个环节丨AIGC日报

    腾讯WorkBuddy上线“独立文件浏览器”,本地文件可在独立窗口查看编辑,文件在左、AI在右,可围绕当前文件总结、分析、修改和润色,且只读取用户主动打开或添加的文件。谷歌向全球用户开放AI生成内容检测工具SynthID Detector,支持识别图片、视频、音频是否由AI生成。阿里蔡崇信预判五年后AI将从显性话题转为隐性基础设施,融入业务每个环节。

  8. AI Engineer(@aiDotEngineer)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Oracle 的 Richmond Alake 将在 AI Engineer New York 谈智能体的业务上下文、权限与记忆

    Oracle 的 Richmond Alake 将于 10 月 13 日在 AI Engineer New York 发表演讲,主题是智能体如何理解业务上下文、权限与记忆——即智能体能写出查询,却未必知道分析师被允许看到什么。Oracle AI Database 是本次活动的 Platinum 赞助商。

  9. AI Engineer(@aiDotEngineer)AI 评估 · 5/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI Engineer New York 10 月 12-14 日举办,聚焦金融 AI 难题

    AI Engineer New York 定于 10 月 12 日至 14 日在纽约时代广场喜来登酒店举行,面向正在构建金融 AI 的团队,邀请带上团队卡住的问题到场。会议需购票入场,Luma RSVP 不含参会资格,工作坊为额外付费项目。

  10. AI Engineer(@aiDotEngineer)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    你的回测看起来很漂亮,但你的智能体偷看了明天的新闻吗?与 Exa 的 Ryan Ahern 一起做回测

    Exa 的 Ryan Ahern 将于 10 月 12 日在 AI Engineer New York 带来回测主题分享,聚焦智能体是否"偷看"了未来信息导致回测结果失真。活动同期可用 Exa Snapshot 检索"昨天的网络",Exa 是本次大会的 Platinum 赞助商,工作坊需另行购买。

  11. AI Engineer(@aiDotEngineer)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    WorkOS 的 Isabelle Williams 谈 AI 智能体身份与权限撤销

    WorkOS 的 Isabelle Williams 将在 AI Engineer New York 演讲,主题是 AI 智能体的身份与权限撤销。议题聚焦当智能体代表他人发现 API 并注册后,其权限归属问题。活动于 10 月 13 日举行,WorkOS 是白金赞助商。

  12. 歸藏(guizang.ai)(@op7418)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    马斯克称 Grok Bot 将按任务调用 Claude Opus 5.5、Midjourney、Suno 等外部模型 API

    马斯克表示,Grok Bot 今后会针对具体任务选用最合适的后端模型,不再局限于 Grok 4.7 或 4.6,也会调用 Claude Opus 5.5、Midjourney、Suno 以及其他领先 API,以求给出最好的结果。转述该消息的博主认为,Grok Bot 将借此具备构建内容和执行任务的能力。

  13. 歸藏(guizang.ai)(@op7418)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用户向 @bot 申请 guziang@grokbot.com 机器人邮箱

    有用户发推 @bot,询问能否为自己的机器人申请 guziang@grokbot.com 邮箱地址。该推文获得 7 个点赞、4 条回复和 12910 次浏览。

  14. The Rundown AI(@TheRundownAI)AI 评估 · 0/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    The Rundown AI 每日速递:AI 前沿动态解读

    The Rundown AI 发布每日 AI 资讯速递,引导读者前往其 beehiiv 页面阅读完整内容。该推文仅含跳转链接,未披露具体模型、参数或发布信息。

  15. The Rundown AI(@TheRundownAI)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    今日机器人要闻:Minerva 造排爆人形机器人,Agilink 教机械手刺绣

    机器人领域今日要闻:Minerva 打造了一款用于排爆的人形机器人,Agilink 教会机械手做刺绣。另有一款微型机器人靠每走一步充电,MIT 则为无人机赋予了数学层面的生存本能。

  16. meng shao(@shao__meng)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软将 Windows 定位为 hybrid intelligence 之家,发布四层 AI Agent 架构

    微软正式将 Windows 的战略定位从个人计算平台升级为 the home for hybrid intelligence,作为 AI Agent 在本地与云端的承载、安全隔离和企业管理主阵地,并发布四层架构。

  17. 宝玉(@dotey)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Max 和 Team 订阅用户每月获赠 API 额度

    本周起,Claude 的 Max 和 Team 订阅用户每月会拿到一笔 API 额度:Max 5x 为 100 美元,Max 20x 为 200 美元,Team 最多 500 美元,由团队成员共用。这笔额度只能在 Claude Platform 上使用。

  18. 小互(@imxiaohu)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    马斯克宣布 Grok Bot 改用顶级模型驱动,包括 Claude Opus 5.5、MidJourney、Suno

    马斯克宣布 Grok Bot 今后将针对不同任务调用最佳后端模型,包括 Claude Opus 5.5、MidJourney、Suno 及其他领先 API,以求得最优结果。他称 SpaceX 也将采用同样策略。此举疑似为即将推出的大一统订阅服务做准备。

  19. 爱范儿AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    早报|苹果一大波新品曝光,最快下周发布/全球纯汽油车份额首次跌破50%/2599 美元起,Surface Laptop Ultra发布

    OpenAI 10 月 7 日起向 ChatGPT Plus、Pro、Business 和 Enterprise 用户推送 GPT-6,新增可组合图形、按钮、表单的「Intelligent UI」,内部评测中 GPT-6 Instant 比 GPT-5.6 Instant 提前 44% 开始回答需联网搜索的问题。

  20. 爱范儿AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软与英伟达发布 RTX Spark 和 Surface Laptop Ultra,提出为「无限智能」重构 PC

    微软在 Windows 与 Surface 特别活动上联合英伟达推出 ARM 架构 SoC RTX Spark,把 CPU、GPU 和最高 128GB 统一内存集成在一起,FP4 AI 算力最高 1 PFLOP,可在本地运行 1250 亿参数的 Qwen 3.8 Flash Next 等模型。

  21. Qwen(@Alibaba_Qwen)AI 评估 · 0/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen 致谢 @gmi_cloud 支持

    Qwen 官方账号发帖感谢 @gmi_cloud 的支持,该帖获得 30 次点赞、4 条回复、6 次转发及 11127 次浏览。

  22. InfoQAI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cloudflare 用 AI 测试框架探测并加固其 WAF

    Cloudflare 将前沿 AI 模型放入受控测试框架中探测其 WAF,以已拦截的攻击载荷为起点让模型生成并迭代新变体,在 45 个场景中产生 1,107 次尝试,经人工筛查后留下 49 项发现。

  23. InfoQAI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    InfoQ 网络研讨会:AI 进入生产环境,什么会崩、什么可行、谁来把关?

    InfoQ 将于 10 月 14 日举办免费 60 分钟线上研讨会"AI in Production: What Breaks, What Works, and Who Approves It?

  24. Lenny Rachitsky(@lennysan)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Every 为 Checks 个人基准测试平台招聘产品经理

    Every 已构建个人基准测试平台 Checks,用于让任何人测量新模型在自己实际工作上的表现。Dan Shipper 发布招聘信息,寻找理解这一方向重要性、并愿意参与把 Checks 建设为人类借助 AI 完成高质量工作未来形态的产品经理。

  25. lmarena.ai(@lmarena_ai)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Arena 完成 2 亿美元 B 轮融资,估值 31 亿美元并发布 Alignment Index

    Arena 宣布完成 2 亿美元 B 轮融资,估值 31 亿美元,同时发布 Arena Alignment Index。该指数基于真实世界智能体轨迹构建,首批包含 Unauthorized Action、False Attribution 和 Deceptive Completion 三项信号,今日公布 20 多个前沿模型的结果。

  26. lmarena.ai(@lmarena_ai)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LMArena 完成 Series B 融资,由 Lightspeed 与 Khosla Ventures 联合领投

    LMArena(@arena)完成 Series B 融资,由 Lightspeed Venture Partners 和 Khosla Ventures 联合领投,Salesforce Ventures、01Avisors、Dell Technologies Capital 和 Endeavor Catalyst 参投。

  27. lmarena.ai(@lmarena_ai)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LMArena 团队正在招聘

    打造 LMArena 的团队称"正在招聘",Clayton Thorrez 表示参与公司成长是终身难忘的经历,并附上 jobs.ashbyhq.com/arena 招聘链接。

  28. lmarena.ai(@lmarena_ai)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    lmarena 与 Khosla Ventures 合作,衡量 AI 智能体真实世界行为

    lmarena 宣布与 Khosla Ventures 合作。Khosla Ventures 的 Tal Broda 表示,lmarena 打造了业界最重要的 AI 排行榜,如今正在衡量 AI 智能体在真实世界中的行为表现,这项工作对实现安全且对齐的 AGI 至关重要。

  29. lmarena.ai(@lmarena_ai)AI 评估 · 9/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LMArena 预告与 MTSlive 的独家内容

    LMArena 预告即将发布与 MTSlive 的独家内容,具体形式和时间未公布。相关帖文同时提到 @arena 完成 2 亿美元融资,并转述了 Brent Liang 关于 mts 赞助的表态。

  30. lmarena.ai(@lmarena_ai)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Arena 完成 2 亿美元 B 轮融资,估值 31 亿美元并推出 Alignment Index

    Arena 宣布完成 2 亿美元 B 轮融资,估值 31 亿美元。Felicis 表示其年化营收已超过 1 亿美元,累计支持 3.5 亿次会话和 6200 万次投票,并成为全球最大的 AI 社区之一。Arena 同时推出新的 Alignment Index,用于衡量 AI 智能体是否安全、真实地行事,以及是否在用户实际要求范围内行动。

  31. lmarena.ai(@lmarena_ai)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LMArena 完成 2 亿美元 B 轮融资,Lightspeed 追加投资并推出 Alignment Index

    LMArena 完成 2 亿美元 B 轮融资,Lightspeed 继种子轮后继续加注。Arena 年化收入已超 1 亿美元,另有数百万用户通过真实使用参与前沿模型评估。Arena 同时推出 Alignment Index,用于衡量 AI 行为在真实场景中与人类价值观的一致程度。

  32. lmarena.ai(@lmarena_ai)AI 评估 · 7/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LMArena 团队招募消费级 App 设计师

    LMArena 团队正在为旗下消费级应用招聘设计师,要求有深厚消费产品经验。团队成员 @johnnnavent 称这是又一个重大里程碑,并邀请有意者私信联系。招聘入口为 arena.ai/company/careers。

  33. lmarena.ai(@lmarena_ai)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    lmarena.ai 宣布继续与 a16z 团队合作

    lmarena.ai 表示将继续与 a16z 及其团队合作,并向 @ml_angelopoulos、@infwinston、@istoica05 表示祝贺,称短时间内取得的成果令人惊叹。Robert Weber 提到,仿佛就在昨天大家还在规划如何把团队从 5 人扩展到 20 人。

  34. lmarena.ai(@lmarena_ai)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 模型排行榜背后的初创公司以 31 亿美元估值完成新一轮融资

    运营热门 AI 模型排行榜的初创公司完成新一轮融资,估值达 31 亿美元。该消息由 Bloomberg 报道,LMArena 官方账号引用并邀请读者查看详情。

  35. lmarena.ai(@lmarena_ai)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LMArena 推出 Alignment Index,追踪智能体撒谎、越权删文件等对齐问题

    LMArena 上线 Alignment Index,并发布完整技术报告与排名,评估范围从此前的人类偏好扩展至模型对齐。该指数聚焦三类问题:模型采取未授权操作、欺骗性输出(声称已完成实际未做)、以及错误归因人类意图;其 CEO 称智能体撒谎、未经许可删除文件、绕过权限等现象正普遍发生。

  36. lmarena.ai(@lmarena_ai)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Arena 完成 2 亿美元 B 轮融资,估值 31 亿美元并推出 AI Alignment Index

    Arena 宣布完成 2 亿美元 B 轮融资,估值达 31 亿美元,同时推出 Arena AI Alignment Index,用于衡量 AI 智能体在真实世界中的行为表现。该公司起源于 UC Berkeley 的一个研究项目,Felicis 在其种子轮即参与投资并领投了 A 轮。

  37. lmarena.ai(@lmarena_ai)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Salesforce Ventures 投资 Arena 的 B 轮融资

    Salesforce Ventures 宣布投资 Arena 的 Series B 轮。Arena 让真实用户在文本、编程、视觉、图像生成和智能体任务上匿名对比模型输出并投票,其实时排行榜被实验室用来决定训练和发布哪些模型,也被开发者用来决定购买哪些模型。该平台强调没有任何实验室拥有记分牌,这种中立性使其在 AI 生态中占据关键位置。

  38. cohere(@cohere)AI 评估 · 2/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cohere 开放 Compass 计划申请

    Cohere 开放 Compass 计划申请通道,可通过 cohere.com/compass 提交申请。原文未披露该计划的具体内容、名额或资格要求。

  39. Satya Nadella(@satyanadella)AI 评估 · 9/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Satya Nadella 分享 Windows 体验团队公告详情

    Satya Nadella 发推附上 Windows 体验博客链接,引导读者了解已公布的内容。原文未透露公告的具体产品、功能或版本信息。

  40. LangChain(@LangChainAI)AI 评估 · 5/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Tavily 赞助 Interrupt London,展示 AI 智能体联网方案

    Tavily 赞助 Interrupt London,并在活动期间设立展位,展示如何将 AI 智能体连接到网络。活动由 LangChain 发布消息,互动数据为 13 个点赞、5 条回复、2 次转发。