跳到正文

#部署/工程

今日 0 条
9月22日周二
  1. Jerry Liu(@jerryjliu0)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jerry Liu 推出 DocJev:比 gpt-5.6-luna 快 6 倍的文档分类与切分开源库

    Jerry Liu 发布开源库 DocJev,用于文档分类与切分,速度比 gpt-5.6-luna 快 6 倍且精度相当。用户只需给出文档和自然语言类别规则,Jev 即可预测文档类别或子文档边界,并支持 liteparse 与 LlamaParse 两种 OCR 后端。

  2. Thomas Wolf(@Thom_Wolf)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Aikido 推出开源权重安全模型 Altar-1,基于 GLM 5.3 剪枝量化

    Aikido 发布首个开源权重安全模型 Altar-1,具备接近前沿水平的防御能力,其基础是开源 SOTA 模型 GLM 5.3 的剪枝量化版本,轻量到可装进单个 4-H200s 节点。

  3. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Logan Kilpatrick:用 AI 做产品,应花超过 25% 的时间做 benchmark

    Logan Kilpatrick 建议,用 AI 构建产品的团队应把超过 25% 的时间花在制作 benchmark、并推动模型实验室关注这些 benchmark 上。他称这是加速公司进展的最快路径。

  4. NVIDIA Technical BlogAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA TensorRT 多设备推理集成进 Dynamo-Triton,跨多 GPU 简化模型服务

    NVIDIA TensorRT 推出多设备推理能力,让单个 TensorRT 网络借助 NCCL 分布式集合通信跨多 GPU 执行,同时保留 TensorRT 的推理优化。该能力自 TensorRT 11.0 起获得完整支持,并已集成进 NVIDIA Dynamo-Triton,用于简化多 GPU 模型服务。

  5. Anton Osika – eu/acc(@antonosika)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anton Osika:我们的 harness 专为构建 Web 应用微调,按需路由至 OAI 或 Anthropic

    Anton Osika 表示其团队的 harness 已针对构建 Web 应用做微调,会依据用户请求内容在 OAI 与 Anthropic 之间路由,并自动拉取全部调试数据。他邀请开发者试用该工具。

  6. Lovable(@lovable_dev)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jev 上线 Lovable AI Gateway,9/27 前免费试用

    Jev 现已接入 Lovable AI Gateway,即日起至 9/27 23:59 UTC 可免费用它构建 AI 功能。Alexandre Pesant 同时发布 Jev completions API 与 Jev Playground,称可用其替换现有 LLM 做文本生成。

  7. Cognition(@cognition_labs)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Devin Cloud 限时免费开放 SWE-2,10 月 8 日前可试用

    Cognition 宣布,为庆祝某节点,10 月 8 日前在 Devin Cloud 中免费提供 SWE-2。用户可通过 devin.ai 的博客链接了解详情并试用。

  8. Cognition(@cognition_labs)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Devin 推出 devin ssh,可远程接入其开发环境

    Cognition 为 Devin 推出 devin ssh,可远程接入 Devin 的开发者环境并当作自己的环境使用。用户能直接浏览和编辑代码、启动 dev server 并转发端口测试 Devin 的工作,也可通过 scp 从虚拟机取回文件,完成后用 CLI 的 /handoff 把工作交回本机。

  9. Cognition(@cognition_labs)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cognition 推出 Devin Cloud 终端入口与 devin ssh

    Cognition 为 Devin 的云端计算机推出两种新用法:在 CLI 中通过 /cloud 创建、引导和恢复 Devin Cloud 会话,以及首次支持通过 SSH 登录 Devin 的专属 VM,再用 /handoff 把工作交回自己的设备。

  10. SemiAnalysisAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MoE 推理的计算与数据搬运:Prefill、Midfill、Decode 四阶段解析

    SemiAnalysis 解析 MoE 推理的计算与数据搬运,将模型服务拆为 Prefill、Midfill、Decode attention、Decode experts 四种运行模式,各自对算力、内存和网络的需求不同。

  11. Guillermo Rauch(@rauchg)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.7 上线 Vercel AI Gateway,9 月 27 日前全部 40% 折扣

    Grok 4.7 已在 Vercel 的 AI Gateway、fx 和 eve 上线,主打快、聪明、便宜。9 月 27 日前所有调用享受 40% 折扣,用户可通过 Gateway 配合 fx.sh 或 eve 试用。

  12. Harrison Chase(@hwchase17)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangSmith Gateway 免费托管 SemIf:JevBench 得分 75.4 逼近 jev 的 74.7

    Harrison Chase 称开源决策模型 SemIf 在 JevBench 上得分 75.4,与 jev 的 74.7 十分接近,且还有多个开源替代方案。SemIf 基于 qwen3.5,LangSmith Gateway 将免费托管一周。

9月21日周一
  1. LangChain BlogAI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 实测 TypeSafe AI 的 Jev 能否成为更好的 Agent 评估器

    LangChain 用 Deep Agents 构建天气 agent,在 LangSmith 数据集上对比 TypeSafe AI 的 Jev 与 GPT-5.6 Luna、GPT-5.6 Terra、Claude Sonnet 4.6 三种 LLM 评委。

  2. NVIDIA Technical BlogAI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA Earth-2 如何把最新观测数据转化为及时气象决策

    NVIDIA Earth-2 面向天气敏感行业,将能源企业的风光资产测量、应急管理团队的雷达与本地传感器数据、卫星观测等最新观测整合,用于更早地获取本地化天气变化视角并管理物理风险。该平台帮助各行业把观测数据转化为及时的气象决策,相关数据覆盖能源、应急管理与卫星等多个领域。

  3. Runway(@runwayml)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Runway 9 月 30 日旧金山线下黑客松:用 Runway API 构建智能体、应用或创意工作流

    Runway 将于 9 月 30 日在旧金山 Masonic 举办为期一天的线下黑客松,与 Runway AI Summit 同场,参赛者需用 Runway API 构建智能体、应用或创意工作流。活动不设路演和审批流程,下午 5 点前提交可运行 demo,即有机会赢取 25K 美元和 200K credits。

  4. AI科技大本营AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google Research 负责人 Yossi Matias:AI 正终结岗位头衔,初级员工要一出道就硬抗判断力

    Google Research 副总裁 Yossi Matias 在官方播客《The Google Research Podcast》首期访谈中表示,AI 正在终结"岗位头衔",以往需要熬 15 年才练出的判断力,如今初级员工一出道就得硬抗。

  5. 快手技术AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    快手技术沙龙第五期回顾:聚焦 Data Agent,共探数据生产与智能决策新范式

    快手在第五期技术沙龙上首次系统披露 Data Agent 规模化落地数据:平台 WAU 突破 10,600,周人均对话 55 次,数据分析师与产品运营渗透率超 80%,NPS 达 73.5,单次任务提效中位数 13 倍。

  6. 魔搭ModelScope社区AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Convai Innovations 开源 421M 参数决策模型 Laya,33 毫秒完成 System 1 决策

    Convai Innovations 开源了非自回归 System 1 决策模型 Laya,含 421M 参数,基于 ModernBERT-large 主干和 RLCD 训练概率输出,GPU 推理延迟 33~38 毫秒,采用 Apache 2.0 协议,可在本地部署。

  7. 机器之心SOTA模型AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阶跃星辰发布 Step 5 Preview,千问开源 Qwen-Image-2.1,TypeSafe AI 开放 Jev

    阶跃星辰发布 Step 5 Preview,采用稀疏 MoE 架构,总参数 600B、每 Token 激活 27B,支持 100 万 Token 上下文与视觉输入,已通过阶跃产品与 API 提供,完整权重计划于 10 月 15 日发布。

  8. Hailuo AI (MiniMax)(@Hailuo_AI)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    社区开发者用 Jev 稀疏化 MiniMax H3 注意力,RTX4070 视频生成提速 41.7%

    开发者 Kamimoto 将 Jev 集成进 MiniMax H3,对 4step、49 层的注意力处理做稀疏化,由 Jev 逐层判定重要度并选择 1%、3%、5%、10% 的稀疏率,在 RTX4070 上把视频生成从 6 分 7 秒缩短到 3 分 34 秒,提速 41.7%。

  9. Hailuo AI (MiniMax)(@Hailuo_AI)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MiniMax H3 集成 Jev 稀疏注意力,视频生成提速 41.7%

    开发者 Kamimoto 将 Jev 接入 MiniMax H3,用其对 4step、49 层的注意力做稀疏化处理,按层判定重要度并可选 1%、3%、5%、10% 稀疏率。在 RTX4070 上,视频生成时间从 6 分 7 秒缩短到 3 分 34 秒,减少 41.7%。即便生成过程中需向 Jev 云端查询,速度仍有提升。

  10. 大淘宝技术AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    大淘宝技术:Loop engineering 如何把 agent 放进工程循环

    大淘宝技术会员技术团队提出 Loop engineering 理念,工程师不再逐轮提示 agent,而是设计包含读取状态、判断任务、执行、验证、记录状态和判断停止条件的自动化循环。

  11. Qwen(@Alibaba_Qwen)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SGLang-Diffusion 首日支持 Qwen-Image 2.1:文生图、多图编辑与 RGBA 透明输出

    SGLang-Diffusion 在 Qwen-Image 2.1 发布首日即提供支持,覆盖文生图、多图编辑和透明 RGBA 输出,单个 checkpoint 即可完成。

  12. 沃垠AIAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测阶跃星辰 Step 5 Preview:五项任务表现如何

    作者冷逸把阶跃星辰 Step 5 Preview 的 API 接入 WorkBuddy 实测,覆盖前端网页、塔防游戏、3D 互动游戏、跨平台适配和运营报告 PPT 五类任务,其中塔防游戏一次性生成且可通关,3D 游玩与关卡设计离 GPT-6 仍有差距。

  13. QdrantAI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lucy 如何用 Qdrant 为 280 万份 SEC 与 DART 文件构建可信检索层

    Lucy 基于 Qdrant 为超 280 万份 SEC 与 DART 监管文件构建检索层,混合检索加 RRF 后 FinanceBench Recall@5 达 93.4%、Recall@10 达 94.7%。

  14. Vercel NewsAI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vercel AI Gateway 新增 TypeSafe 客户端与 HTTP API 调用 Jev

    Vercel AI Gateway 现已支持通过 TypeSafe 客户端、HTTP API 和 AI SDK 三种方式调用概率决策模型 Jev。Jev 接收状态并输出带概率的类型化答案,不生成文本,新集成以 typesafe-ai/jev 命名,支持 boolean、choice、score 三类问题,三条路径的请求均通过 AI Gateway 计费并计入用量与可观测性。

  15. Vercel NewsAI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vercel AI Gateway 上线 SpaceXAI 的 Grok 4.7,9 月 27 日前调用享 40% 折扣

    Vercel 宣布 SpaceXAI 的 Grok 4.7 已在 AI Gateway 上线,模型 ID 为 spacexai/grok-4.7,9 月 27 日前使用该 ID 的请求自动享 40% 折扣。

  16. AI炼金术AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    鹿客陈彬谈 AI 原生组织改造:CEO 兼 HR 一号位,圈长管奖金包

    鹿客创始人陈彬把公司重写成 AI Native 组织,自己兼 HR 一号位,新设 HARO 统管人与 AI 资源,主张"能让 AI 做的就尽量别让人做"。业务侧改为端到端闭环的"圈子",奖金包由圈长决策,职能只剩建议权,agent builder 与 FDE 不脱产、投入 30% 到 50% 精力。

  17. GitHub(@github)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub 法务团队如何更多使用 Copilot CLI

    GitHub 法务团队正在用 Copilot CLI 处理更多法律相关工作,相关做法在 GitHub 官方博客的 AI 与 ML 板块公开分享。帖子未披露具体模型版本、参数或性能数字。

9月20日周日
  1. Tw93(@HiTw93)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    为让 Mole 清理更彻底,我用 AI 装了 300 多款 Mac 软件做卸载测试

    为让 Mac 清理工具 Mole 卸载更彻底,作者整理 300 多款 Mac 软件共约 100 多 G,分成 30 组,用最强 Extra High Fast 模型借 computer use 每次 10 个自动下载、安装、卸载并查找残留。过程补充了 13 类通用规则、90 多条精确清理路径,修正 30 多个误清点,并新增 100 多条单元测试。

  2. Harrison Chase(@hwchase17)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 探索用 Jev 构建更好的 harness,下周举办 webinar

    LangChain 正在探索如何用 Jev 构建更好的 harness,并将于下周联合 @sydneyrunkle、@huntlovell 以及 @typesafeai 的 Allie 举办 webinar。活动报名地址为 events.langchain.com。

  3. AI科技大本营AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Android 开发者 Jake Wharton 谈拒用 AI:补贴退潮后 LLM 成本会贵过工程师

    前 Google Kotlin 团队首位工程师 Jake Wharton 在采访中表示,他在求职时把不加入 AI 公司、不做 AI 核心产品列为第一条要求,这让他放弃了约 80% 的潜在机会。

  4. 甲子光年AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    零跑发布世界模型智驾系统,35万辆激光雷达车型可免费升级

    零跑于2026年9月16日正式发布世界模型智驾系统,放弃BEV表征与激光雷达信息接入,采用图像到动作架构,激光雷达仅作安全兜底。同日朱江明宣布已售出的35万辆激光雷达车型用户可免费升级该系统。

  5. 快手技术AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    快手电商直播如何落地业界首个大规模实时字幕系统 Live Captioning Engineering

    快手电商直播技术团队将"主播说话到字幕上屏"端到端耗时从1.5~2秒压缩到400~500毫秒,字错率(CER)从7.81%降至3.51%,并支撑千万级持续并发分发。系统按"拉流—识别—对齐—分发—渲染"链路建设,用 PTS 队列统一媒体时间线,以房间事件加两级级联实现一份计算多方消费,客户端按播放器 PTS 驱动字幕渐进吐字与修正。

  6. andrew chen(@andrewchen)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 的 Andrew Chen:AI 原生消费应用距离 ARPU 覆盖推理成本还差 10 倍以上

    a16z 的 Andrew Chen 认为,AI 原生消费应用要实现普及,需月均 ARPU 高于单用户平均推理成本,但当前月 ARPU 约 2-5 美元,而 AI 重度应用的 token 成本达 20-50 美元,差距超过 10 倍。

  7. Scott Wu(@ScottWu46)AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Devin Mac 技术深潜:用 Rust 从零重建磁盘、网络、VNC 与 computer use

    Jon Kelley 发文详解 Devin Mac 的构建过程,团队耗时数月用 Rust 从零重建了它的磁盘、网络、资源调配、VNC 和 computer use。这是 Devin Mac 首次公开的技术细节,原文以 X 文章形式发布。

  8. GitHub(@github)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub 分享从原型到生产的 LLM 评测实践

    GitHub 指出,语言模型在干净 benchmark 上表现优异,仍可能在真实场景的关键 case 上失败。GitHub 分享了帮助其从有前景的原型结果走向生产的评测实践。

  9. AI炼金术AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    XMind 的 AI 原生组织:最关键是减少人与人之间的摩擦

    XMind 联合创始人 Mango 披露公司 AI 组织转型:增长和市场部门被打散、测试团队解散,职能退化为只管技能等级认证的社区,圈长必须真分钱而不只是打分。

  10. 印记中文AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    React 中文周刊 #293:AI 时代下,前端框架还有意义吗?

    Remix 团队成员 Brooks Lybrand 撰文质疑"Just let AI use React"的说法,认为 AI agent 不用框架会自行拼凑"土法炮制"的框架,因此需要具备更优抽象与约束的新一代框架。

9月19日周六
  1. 甲子光年AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    探访高通总部:6G网络如何从传输数据走向感知与计算?

    高通在圣迭戈总部搭建面向5G和6G的研发测试平台,用无线信号追踪无人机并由AI分类,展示其6G愿景的连接、感知、高性能计算三大基石。高通提出"计算连续体"多层架构,并计划推出面向家庭和小企业、可承载万亿级参数模型的设备形态;同时探索把AI算力下沉到基站侧,供运营商提供"算力即服务"或"Token即服务"。