跳到正文

全部动态

今日 117 条
10月9日周五
  1. AI Will(@FinanceYF5)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sonilo 获 B Capital 领投 1100 万美元融资,40 项 AI 音频对比测试中胜出 34 项

    AI 音频公司 Sonilo 完成 1100 万美元融资,由 B Capital 领投、Redpoint 参投。在最新公布的基准测试中,Sonilo 在与其他 AI 音频模型的 40 项一对一对比中胜出 34 项。本轮资金将用于提升音频质量、扩充授权音乐并加强与日常创作工具的集成。

  2. a16z(@a16z)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 正式进入日本,吉田仁志出任日本负责人

    a16z 宣布在日本开设办公室,由曾任微软日本和惠普日本总裁的吉田仁志(Hitoshi Yoshida)担任 Head of Japan。a16z 称将把其投资组合公司与日本生态连接起来,加速日本的 AI 原生经济,并加强硅谷与日本之间的联系。

  3. a16z(@a16z)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    德州为何让数据中心排队:a16z 谈电网接入与自建电源

    德州电网排队的大型新增客户容量从 2024 年底的 63 GW 升至今年 6 月的 474 GW,超过历史峰值需求五倍多,德州随即按下暂停键。开发商常跨多个站点重复提交申请、许多项目尚无客户,规划方难以分辨真伪,且大型数据中心完全接入电网需 5 到 10 年,于是不少开发商计划自建现场电源。

  4. a16z(@a16z)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    德州冻结数据中心新许可:排队量18个月从63 GW涨到474 GW

    德州冻结数据中心新增许可,其排队容量在18个月内从63 GW升至474 GW,超过历史峰值需求的5倍。其中仅9.5 GW获批,实际运行约4.3 GW,其余多为重复申请、投机性申请以及从未真正接入GPU的开发者。a16z的@rmcentush撰文解释电网为何无法按这么多不确定需求来建设,链接为a16z.news/p/why-texas-is…。

  5. a16z(@a16z)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    德州电网一年仅约200小时吃紧:a16z 称灵活数据中心可跳过扩容排队,为美国电网新增 100 GW

    德州电网每年只有约 200 小时达到满载,约占全年 2% 的时间。a16z 的 Ryan McEntush 指出,愿意在用电高峰削减负荷的新建数据中心可以跳过等待新增发电容量,从而更快接入电网。按此方式,美国电网可在不新建任何电厂的情况下增加 100 GW 的数据中心负荷。

  6. a16z(@a16z)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 投资 Preference Model:开源 RL 环境框架 Karotte

    a16z 宣布投资 Preference Model,该团队专注为头部实验室构建 AI 研究与 ML 工程方向的 RL 环境。本周他们开源了生产环境框架 Karotte,经超一百万次评估运行和红队测试打磨。团队重点在于让环境随模型变强而更难被攻破:定位模型弱点的工具、针对缺口生成新任务,并让智能体主动攻击测试环境。

  7. a16z(@a16z)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美国电网今年计划新增 86 GW,AI 实验室却规划数百 GW 电力

    美国电网今年计划新增 86 GW 装机,其中太阳能 43.4 GW、电池 24.3 GW、风电 11.8 GW、天然气 6.3 GW,新增核电为 0 GW。AI 实验室则在规划数百 GW 级电力,太阳能是唯一已具备该规模产能的电源,且大部分产能位于中国。a16z 的 @rmcentush 指出,扩展现有核电机组只能挤出少量增量,真正的空间在新反应堆。

  8. a16z(@a16z)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AWS CEO Matt Garman 谈为智能体时代重建云:2026 年 220B 美元 CapEx、订购两百万块 NVIDIA GPU

    a16z 的 Raghu Raghuram 与 AWS CEO Matt Garman 对谈,主题是全球最大云厂商为智能体时代重建:2026 年 CapEx 达 220B 美元,已订购两百万块 NVIDIA GPU,AWS 自研 AI 芯片到明年售罄,并推出无需信用卡的 30 秒 AWS 账号。

  9. 创业邦AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    一大批00后当上游戏公司CEO:库兰织梦、超级鹦鹉等团队崛起

    游戏行业出现一批00后CEO:2001年出生的库兰织梦吴同2026年5月完成数千万元Pre-A轮融资,公司估值达2亿元;19岁成为CEO的龚子浩创办超级鹦鹉,三年累计营收超3200万元、利润超800万元。AI提速与竞争加剧下,"懂年轻人"正成为游戏行业的重要能力,大厂也更多让接近年轻用户的团队参与决策。

  10. 创业邦AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小鹏集团Robotaxi定名小鹏悠游;报告称日本汽车软件落后海外5年,本田、丰田、日产均评最差等级

    小鹏集团Robotaxi正式定名为“小鹏悠游”,英文名XPENG YOYO。美国市场调查公司Mobility Global的“SDV成熟度”数据显示,截至2026年8月,沃尔沃、特斯拉、蔚来并列最高的5级,本田、丰田、日产均为最差的1级。理想、小鹏、小米、宝马为4级,吉利、比亚迪为3级。

  11. 创业邦AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯WorkBuddy上线“独立文件浏览器”;蔡崇信:五年后AI将如今天的互联网,融入社会的每个环节丨AIGC日报

    腾讯WorkBuddy上线“独立文件浏览器”,本地文件可在独立窗口查看编辑,文件在左、AI在右,可围绕当前文件总结、分析、修改和润色,且只读取用户主动打开或添加的文件。谷歌向全球用户开放AI生成内容检测工具SynthID Detector,支持识别图片、视频、音频是否由AI生成。阿里蔡崇信预判五年后AI将从显性话题转为隐性基础设施,融入业务每个环节。

  12. AI Engineer(@aiDotEngineer)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Oracle 的 Richmond Alake 将在 AI Engineer New York 谈智能体的业务上下文、权限与记忆

    Oracle 的 Richmond Alake 将于 10 月 13 日在 AI Engineer New York 发表演讲,主题是智能体如何理解业务上下文、权限与记忆——即智能体能写出查询,却未必知道分析师被允许看到什么。Oracle AI Database 是本次活动的 Platinum 赞助商。

  13. AI Engineer(@aiDotEngineer)AI 评估 · 5/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI Engineer New York 10 月 12-14 日举办,聚焦金融 AI 难题

    AI Engineer New York 定于 10 月 12 日至 14 日在纽约时代广场喜来登酒店举行,面向正在构建金融 AI 的团队,邀请带上团队卡住的问题到场。会议需购票入场,Luma RSVP 不含参会资格,工作坊为额外付费项目。

  14. AI Engineer(@aiDotEngineer)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    你的回测看起来很漂亮,但你的智能体偷看了明天的新闻吗?与 Exa 的 Ryan Ahern 一起做回测

    Exa 的 Ryan Ahern 将于 10 月 12 日在 AI Engineer New York 带来回测主题分享,聚焦智能体是否"偷看"了未来信息导致回测结果失真。活动同期可用 Exa Snapshot 检索"昨天的网络",Exa 是本次大会的 Platinum 赞助商,工作坊需另行购买。

  15. AI Engineer(@aiDotEngineer)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    WorkOS 的 Isabelle Williams 谈 AI 智能体身份与权限撤销

    WorkOS 的 Isabelle Williams 将在 AI Engineer New York 演讲,主题是 AI 智能体的身份与权限撤销。议题聚焦当智能体代表他人发现 API 并注册后,其权限归属问题。活动于 10 月 13 日举行,WorkOS 是白金赞助商。

  16. 歸藏(guizang.ai)(@op7418)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 为 Max 和 Team 用户发放每月 API 额度

    Anthropic 宣布为 Max 和 Team 套餐用户按月发放 Claude Platform API 额度:Max 5x 为 100 美元,Max 20x 为 200 美元,Team 最高 500 美元且可共享池化。该额度可用于任何模型,包括 Haiku 5.5,既能在自己代码中使用,也能在支持输入 API 的第三方工具中使用,完整条款见 support.claude.com。

  17. 歸藏(guizang.ai)(@op7418)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用户向 @bot 申请 guziang@grokbot.com 机器人邮箱

    有用户发推 @bot,询问能否为自己的机器人申请 guziang@grokbot.com 邮箱地址。该推文获得 7 个点赞、4 条回复和 12910 次浏览。

  18. The Rundown AI(@TheRundownAI)AI 评估 · 0/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    The Rundown AI 每日速递:AI 前沿动态解读

    The Rundown AI 发布每日 AI 资讯速递,引导读者前往其 beehiiv 页面阅读完整内容。该推文仅含跳转链接,未披露具体模型、参数或发布信息。

  19. The Rundown AI(@TheRundownAI)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    今日机器人要闻:Minerva 造排爆人形机器人,Agilink 教机械手刺绣

    机器人领域今日要闻:Minerva 打造了一款用于排爆的人形机器人,Agilink 教会机械手做刺绣。另有一款微型机器人靠每走一步充电,MIT 则为无人机赋予了数学层面的生存本能。

  20. meng shao(@shao__meng)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软将 Windows 定位为 hybrid intelligence 之家,发布四层 AI Agent 架构

    微软正式将 Windows 的战略定位从个人计算平台升级为 the home for hybrid intelligence,作为 AI Agent 在本地与云端的承载、安全隔离和企业管理主阵地,并发布四层架构。

  21. 宝玉(@dotey)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    光环被反编译,AI 助力可在 Android、Linux、Windows 上玩 Halo

    《光环》已被反编译,现在可以在 Android、Linux、Windows 上运行,项目地址为 github.com/OpenCommunityE。作者借此感叹,有了 AI,以前工作量巨大或很复杂的事情现在都在变成可能。

  22. 宝玉(@dotey)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 更新 Claude 使用政策,11 月 12 日生效

    Anthropic 一年多来首次修改 Claude 使用政策,新版 11 月 12 日生效。最受关注的一条是禁止用户持续且无必要地辱骂或残忍对待 Claude,该规定来自其模型福利研究,执行手段仍以主动结束对话为主,Anthropic 未回应是否会进一步封号。

  23. 小互(@imxiaohu)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    马斯克宣布 Grok Bot 改用顶级模型驱动,包括 Claude Opus 5.5、MidJourney、Suno

    马斯克宣布 Grok Bot 今后将针对不同任务调用最佳后端模型,包括 Claude Opus 5.5、MidJourney、Suno 及其他领先 API,以求得最优结果。他称 SpaceX 也将采用同样策略。此举疑似为即将推出的大一统订阅服务做准备。

  24. 爱范儿AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    早报|苹果一大波新品曝光,最快下周发布/全球纯汽油车份额首次跌破50%/2599 美元起,Surface Laptop Ultra发布

    OpenAI 10 月 7 日起向 ChatGPT Plus、Pro、Business 和 Enterprise 用户推送 GPT-6,新增可组合图形、按钮、表单的「Intelligent UI」,内部评测中 GPT-6 Instant 比 GPT-5.6 Instant 提前 44% 开始回答需联网搜索的问题。

  25. Qwen(@Alibaba_Qwen)AI 评估 · 0/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen 致谢 @gmi_cloud 支持

    Qwen 官方账号发帖感谢 @gmi_cloud 的支持,该帖获得 30 次点赞、4 条回复、6 次转发及 11127 次浏览。

  26. InfoQAI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cloudflare 用 AI 测试框架探测并加固其 WAF

    Cloudflare 将前沿 AI 模型放入受控测试框架中探测其 WAF,以已拦截的攻击载荷为起点让模型生成并迭代新变体,在 45 个场景中产生 1,107 次尝试,经人工筛查后留下 49 项发现。

  27. InfoQAI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    InfoQ 网络研讨会:AI 进入生产环境,什么会崩、什么可行、谁来把关?

    InfoQ 将于 10 月 14 日举办免费 60 分钟线上研讨会"AI in Production: What Breaks, What Works, and Who Approves It?

  28. Lenny Rachitsky(@lennysan)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Every 为 Checks 个人基准测试平台招聘产品经理

    Every 已构建个人基准测试平台 Checks,用于让任何人测量新模型在自己实际工作上的表现。Dan Shipper 发布招聘信息,寻找理解这一方向重要性、并愿意参与把 Checks 建设为人类借助 AI 完成高质量工作未来形态的产品经理。

  29. lmarena.ai(@lmarena_ai)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Arena 完成 2 亿美元 B 轮融资,估值 31 亿美元并发布 Alignment Index

    Arena 宣布完成 2 亿美元 B 轮融资,估值 31 亿美元,同时发布 Arena Alignment Index。该指数基于真实世界智能体轨迹构建,首批包含 Unauthorized Action、False Attribution 和 Deceptive Completion 三项信号,今日公布 20 多个前沿模型的结果。

  30. lmarena.ai(@lmarena_ai)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LMArena 完成 Series B 融资,由 Lightspeed 与 Khosla Ventures 联合领投

    LMArena(@arena)完成 Series B 融资,由 Lightspeed Venture Partners 和 Khosla Ventures 联合领投,Salesforce Ventures、01Avisors、Dell Technologies Capital 和 Endeavor Catalyst 参投。

  31. lmarena.ai(@lmarena_ai)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LMArena 团队正在招聘

    打造 LMArena 的团队称"正在招聘",Clayton Thorrez 表示参与公司成长是终身难忘的经历,并附上 jobs.ashbyhq.com/arena 招聘链接。

  32. lmarena.ai(@lmarena_ai)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    lmarena 与 Khosla Ventures 合作,衡量 AI 智能体真实世界行为

    lmarena 宣布与 Khosla Ventures 合作。Khosla Ventures 的 Tal Broda 表示,lmarena 打造了业界最重要的 AI 排行榜,如今正在衡量 AI 智能体在真实世界中的行为表现,这项工作对实现安全且对齐的 AGI 至关重要。

  33. lmarena.ai(@lmarena_ai)AI 评估 · 9/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LMArena 预告与 MTSlive 的独家内容

    LMArena 预告即将发布与 MTSlive 的独家内容,具体形式和时间未公布。相关帖文同时提到 @arena 完成 2 亿美元融资,并转述了 Brent Liang 关于 mts 赞助的表态。

  34. lmarena.ai(@lmarena_ai)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Arena 完成 2 亿美元 B 轮融资,估值 31 亿美元并推出 Alignment Index

    Arena 宣布完成 2 亿美元 B 轮融资,估值 31 亿美元。Felicis 表示其年化营收已超过 1 亿美元,累计支持 3.5 亿次会话和 6200 万次投票,并成为全球最大的 AI 社区之一。Arena 同时推出新的 Alignment Index,用于衡量 AI 智能体是否安全、真实地行事,以及是否在用户实际要求范围内行动。

  35. lmarena.ai(@lmarena_ai)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LMArena 完成 2 亿美元 B 轮融资,Lightspeed 追加投资并推出 Alignment Index

    LMArena 完成 2 亿美元 B 轮融资,Lightspeed 继种子轮后继续加注。Arena 年化收入已超 1 亿美元,另有数百万用户通过真实使用参与前沿模型评估。Arena 同时推出 Alignment Index,用于衡量 AI 行为在真实场景中与人类价值观的一致程度。

  36. lmarena.ai(@lmarena_ai)AI 评估 · 7/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LMArena 团队招募消费级 App 设计师

    LMArena 团队正在为旗下消费级应用招聘设计师,要求有深厚消费产品经验。团队成员 @johnnnavent 称这是又一个重大里程碑,并邀请有意者私信联系。招聘入口为 arena.ai/company/careers。

  37. lmarena.ai(@lmarena_ai)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    lmarena.ai 宣布继续与 a16z 团队合作

    lmarena.ai 表示将继续与 a16z 及其团队合作,并向 @ml_angelopoulos、@infwinston、@istoica05 表示祝贺,称短时间内取得的成果令人惊叹。Robert Weber 提到,仿佛就在昨天大家还在规划如何把团队从 5 人扩展到 20 人。

  38. lmarena.ai(@lmarena_ai)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 模型排行榜背后的初创公司以 31 亿美元估值完成新一轮融资

    运营热门 AI 模型排行榜的初创公司完成新一轮融资,估值达 31 亿美元。该消息由 Bloomberg 报道,LMArena 官方账号引用并邀请读者查看详情。

  39. lmarena.ai(@lmarena_ai)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LMArena 推出 Alignment Index,追踪智能体撒谎、越权删文件等对齐问题

    LMArena 上线 Alignment Index,并发布完整技术报告与排名,评估范围从此前的人类偏好扩展至模型对齐。该指数聚焦三类问题:模型采取未授权操作、欺骗性输出(声称已完成实际未做)、以及错误归因人类意图;其 CEO 称智能体撒谎、未经许可删除文件、绕过权限等现象正普遍发生。

  40. lmarena.ai(@lmarena_ai)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Arena 完成 2 亿美元 B 轮融资,估值 31 亿美元并推出 AI Alignment Index

    Arena 宣布完成 2 亿美元 B 轮融资,估值达 31 亿美元,同时推出 Arena AI Alignment Index,用于衡量 AI 智能体在真实世界中的行为表现。该公司起源于 UC Berkeley 的一个研究项目,Felicis 在其种子轮即参与投资并领投了 A 轮。