| Apr 29, 2026 | 说人话理解 RoPE:从 sin/cos 位置编码到旋转矩阵,一次讲清楚 |
| Apr 27, 2026 | 多 Agent 协作不需要说「人话」?LatentMAS 让 LLM 在隐空间里直接协作 |
| Apr 27, 2026 | 写完 Markdown 还要手动排版?我写了个 VS Code 插件一键搞定微信公众号、知乎、小红书 |
| Apr 27, 2026 | Neurips25 | KVCOMM:让多 Agent 系统的 KV Cache 真正“通起来”,TTFT 直接砍掉 7.8 倍 |
| Apr 27, 2026 | KV Cache 也能「语义共享」?SemShareKV 用 LSH 做到了 |
| Apr 26, 2026 | NSDI26 | DroidSpeak让不同 LLM 之间共享 KV Cache |
| Apr 26, 2026 | KV Cache 复用的第三条路:FAST 2026 CacheSlide 是怎么解决 Agent 推理的位置漂移问题的 |
| Apr 24, 2026 | 【论文分享】TokenDance 解决多 Agent LLM 推理的 KV Cache 冗余问题 |
| Apr 24, 2026 | MoE 推理的内存墙,被一块多芯粒芯片打穿了? |
| Apr 03, 2026 | 当 AI 开始学会'记住':LLM Agent 记忆系统的统一视角 |
| Feb 27, 2026 | DAC2026 | ExpertFlow:高效 MoE 推理系统,单卡部署省内存提速度 |
| Nov 12, 2025 | A*STAR CFAR 带薪实习生(1200-1400SGD每月)招募 |
| Oct 31, 2025 | 尝试从源头来理解 SVD 原理和计算 |
| Oct 25, 2025 | LLM技术详解好文指路明灯 |
| Oct 23, 2025 | LLM 场景下的强化学习技术 |
| Oct 21, 2025 | 二叉树的前中后序遍历到底是什么? |
| Oct 17, 2025 | 在各种 AI里反复切换,科研真的更高效了吗? |
| May 19, 2025 | 在新加坡工作,为什么我最终选择了一副能对话的AI耳机来练英语? |
| Apr 19, 2025 | 解决 Overleaf 中插入 PDF 图片失败的问题:排查与修复 |
| Apr 19, 2025 | 使用 Node.js 将 Markdown 转换为 HTML 并截图为小红书风格长图 |
| Feb 20, 2025 | 新加坡科技局大模型实习招聘 |
| Jan 16, 2025 | 科大讯飞最近发布会上新发布的星火语音同传大模型有哪些升级?实用性如何? |
| Nov 12, 2024 | 新加坡 A*STAR 实习生招聘✨ |
| May 03, 2024 | Self-attention 计算 QK^T 为什么要缩放? |
| Apr 21, 2024 | Pytorch 如何使用 storage 实现参数 offload? |
| Mar 23, 2024 | 大模型推理框架 vLLM 源码解析(二):Block 模块分配和管理 |
| Feb 22, 2024 | OpenAI 的视频生成大模型Sora的核心技术详解(一):Diffusion模型原理和代码详解 |
| Feb 04, 2024 | 大模型推理框架 vLLM 源码解析(一):框架概览 |
| Dec 11, 2023 | FastMoE 框架结构解析 |
| Dec 07, 2023 | LLM 学习笔记-Deepspeed-MoE 论文 |
| Dec 02, 2023 | LLM 学习笔记-transformers库的 PreTrainedModel 和 ModelOutput 到底是什么 |
| Dec 01, 2023 | LLM 入门笔记-Tokenizer |
| Nov 28, 2023 | 香港留学经验分享-英语考试篇 |
| Nov 26, 2023 | Megatron-Deepspeed:用Wikipedia数据集训练GPT实战笔记 |
| Nov 26, 2023 | GPT 训练和推理过程示意图 |
| Jul 21, 2023 | FlashAttention算法简介 |
| Jun 24, 2023 | 《Transformer Quality in Linear Time》论文解读 |
| Mar 13, 2023 | NAS Benchmark 数据集汇总 |
| Feb 19, 2023 | 如何多级连跳远程SSH到Windows内部的Ubuntu虚拟机? |
| Dec 11, 2022 | AAAI2023论文 | 基于局部本征维度的高效神经架构搜索算法 |
| Nov 21, 2022 | 自动机器学习框架Hyperbox:妈妈再也不用担心我不会设计模型和调参啦 |
| Nov 09, 2022 | 深度学习并行训练算法一锅炖: DDP, TP, PP, ZeRO |
| Oct 01, 2022 | AutoML方向 博士毕业论文汇总 |
| Sep 29, 2022 | Latex表格太长,一页放不下怎么办?用 longtable |
| Sep 29, 2022 | Latex表格太宽怎么办?用 sidewaystable ! |
| Sep 29, 2022 | Latex 算法模板推荐 |
| Aug 01, 2022 | ICML2022论文 | 虚拟同构化学习:抵御联邦学习中的数据异构性 |
| Jul 30, 2022 | (转载)浅谈高斯过程回归 |
| Jul 28, 2022 | Slurm集群下如何远程连接Jupyter并使用GPU资源? |
| Jul 15, 2022 | MICCAI2022论文 | 进化多目标架构搜索框架:在COVID-19三维CT分类中的应用 |
| Jul 15, 2022 | ECCV2022论文 | EAGAN:一种高效的用于搜索GAN 的两阶段进化算法 |
| Jun 27, 2022 | NVIDIA GPU Cloud (NGC)集群使用笔记 |
| Apr 26, 2022 | [CVPR2021] AttentiveNAS: Improving Neural Architecture Search via Attentive Sampling |
| Apr 20, 2022 | 二项分布期望和方差推导 |
| Apr 18, 2022 | python setup.py 如何把非py文件也打包? |
| Apr 17, 2022 | 说人话理解 伯努利分布&二项分布&泊松分布&指数分布是什么关系? |
| Apr 15, 2022 | ICLR2022 Interesting Papers |
| Apr 10, 2022 | 说人话搞懂极大似然估计和最大后验概率估计 |
| Mar 08, 2022 | 详解Pytorch里的pin_memory 和 non_blocking |
| Jan 15, 2022 | 科研论文配色【不断更新】 |
| Jan 02, 2022 | ICLR2020 | Decoupling representation and classifier for long-tailed recognition |
| Dec 23, 2021 | ICLR2022 | UniNet: Unified Architecture Search with Convolution, Transformer, and MLP |
| Dec 21, 2021 | ICCV 2021 | BossNAS: Exploring Hybrid CNN-transformers with Block-wisely Self-supervised NAS |
| Dec 09, 2021 | ICLR2021 | The Intrinsic Dimension of Images and Its Impact on Learning |
| Sep 15, 2021 | 特征值和特征向量到底是个啥?能做什么用? |
| Sep 14, 2021 | ICCV 2021 | BN-NAS: 只训练BN层来自动搜索模型 |
| Jul 19, 2021 | 搜索一次就完事 Once for all: Train One Network and Specialize it for Efficient Deployment |
| Jul 19, 2021 | OFA-NAS改进版算法:CompOFA利用模型结构搜索维度的复合关系提高搜索效率 |
| Jun 30, 2021 | NAS-Bench-101: Towards Reproducible Neural Architecture Search |
| May 30, 2021 | 【帮推|实习招聘】商汤-研究员-深度学习框架应用实习生 |
| May 25, 2021 | Transformer自下而上理解系列文章目录 |
| May 25, 2021 | Transformer自下而上理解(6) BERT:预训练Transformer |
| May 25, 2021 | Transformer自下而上理解(5) 从Attention层到Transformer网络 |
| May 24, 2021 | Transformer自下而上理解(4) Attention without RNN |
| May 24, 2021 | Transformer自下而上理解(3) Self-attention机制 |
| May 24, 2021 | Transformer自下而上(2) 注意力(Attention)机制 |
| May 24, 2021 | Transformer自下而上(1)机器翻译之Sequence-to-Sequence模型 |
| May 13, 2021 | Retiarii:微软在NAS框架上的新动作,已被顶会OSDI2020接收 |
| Apr 19, 2021 | NLP系列笔记-注意力(Attention)机制 |
| Apr 18, 2021 | NLP系列笔记-机器翻译之Sequence-to-Sequence模型 |
| Mar 23, 2021 | 强化学习3-Policy gradient |
| Mar 22, 2021 | 强化学习2-动作价值函数&DQN |
| Mar 21, 2021 | 强化学习1-基础概念(state,action,reward,policy) |
| Mar 21, 2021 | 中文版深度强化学习课程6:Monte Carlo |
| Mar 21, 2021 | 中文版深度强化学习课程5: |
| Mar 21, 2021 | 中文版深度强化学习课程4:Actor-Critic |
| Mar 21, 2021 | 中文版深度强化学习课程3:策略学习 |
| Mar 21, 2021 | 中文版深度强化学习课程2:动作价值函数 |
| Mar 21, 2021 | 中文版深度强化学习课程1:基础概念 |
| Mar 12, 2021 | Python的super函数直观理解 |
| Jan 30, 2021 | 超详细且包教包会的梯度下降优化算法概览 |
| Jan 14, 2021 | AAAI21-Rebuttal起死回生示例 |
| Jan 12, 2021 | UltraOpt:比HyperOpt更强的超参优化库 |
| Dec 11, 2020 | AutoML: A survey of the state-of-the-art综述期刊论文免费下载 |
| Nov 22, 2020 | 华为诺亚AutoML框架-Vega:(2) 代码结构 |
| Nov 18, 2020 | 通过损失函数优化提高训练速度、准确性和数据利用率 |
| Nov 17, 2020 | 神经网络架构搜索(NAS)最佳科学研究实践指南 |
| Oct 07, 2020 | 【帮推】FedML联邦机器学习框架开源! |
| Sep 23, 2020 | 香港浸会大学月薪4万的博士你会心动吗? |
| Sep 23, 2020 | 华为诺亚实验室AutoML框架-Vega:(1) 介绍 |
| Sep 16, 2020 | 本地机器如何访问服务器上的docker容器内的tensorboard? |
| Aug 21, 2020 | 新记录诞生,腾讯云2分31秒打破ImageNet训练记录 |
| Aug 19, 2020 | 【机器学习】【白板推导系列】课程笔记 |
| Aug 12, 2020 | 电脑神装推荐(一)超级好用的markdown笔记软件: 小书匠 |
| Aug 11, 2020 | 自动搜索损失函数?AM-LFS:AutoML for Loss Function Search |
| Jul 30, 2020 | Andrew Ng机器学习课程笔记 |
| Jul 30, 2020 | Andrew Ng机器学习课程笔记--week9(下)(推荐系统&协同过滤) |
| Jul 30, 2020 | Andrew Ng机器学习课程笔记--week9(上)(异常检测&推荐系统) |
| Jul 30, 2020 | Andrew Ng机器学习课程笔记--week8(K-means&PCA) |
| Jul 30, 2020 | Andrew Ng机器学习课程笔记--week7(SVM) |
| Jul 30, 2020 | Andrew Ng机器学习课程笔记--week6(精度&召回率) |
| Jul 30, 2020 | Andrew Ng机器学习课程笔记--week5 Network: Learning(下) |
| Jul 30, 2020 | Andrew Ng机器学习课程笔记--week5 Network: Learning(上) |
| Jul 30, 2020 | Andrew Ng机器学习课程笔记--week4(神经网络) |
| Jul 30, 2020 | Andrew Ng机器学习课程笔记--week3(逻辑回归&正则化参数) |
| Jul 30, 2020 | Andrew Ng机器学习课程笔记--week2(多元线性回归&正规公式) |
| Jul 30, 2020 | Andrew Ng机器学习课程笔记--week1(机器学习介绍及线性回归) |
| Jul 30, 2020 | Andrew Ng机器学习课程笔记--week11(图像识别&总结划重点) |
| Jul 30, 2020 | Andrew Ng机器学习课程笔记--week10(优化梯度下降) |
| Jul 09, 2020 | AutoML综述更新 【AutoML:A Survey of the State-of-the-Art】 |
| Jul 03, 2020 | Gumbel softmax在可微NAS的作用是什么? |
| Jun 26, 2020 | 【论文笔记系列】Understanding and simplifying One-Shot NAS |
| Jun 10, 2020 | 新冠肺炎胸部CT检测的基准深度学习模型及自动化模型设计 |
| Jun 10, 2020 | 【GAMES101-现代计算机图形学课程笔记】Lecture 10 Geometry 1 (介绍) |
| Jun 02, 2020 | GAMES201:高级物理引擎实战指南-Lecture 1 Taichi编程语言介绍 |
| Jun 01, 2020 | Latex 算法怎么写?(二):算法代码示例 |
| Jun 01, 2020 | Latex 算法怎么写?(一):algorithm, algorithmic算法包到底什么区别? |
| May 28, 2020 | 分布式深度学习算法分析和评测 |
| May 27, 2020 | 【GAMES101-现代计算机图形学课程笔记】Lecture 09 Shading 3 (纹理映射) |
| May 26, 2020 | 【GAMES101-现代计算机图形学课程笔记】Lecture 08 Shading 2 (着色管线) |
| Apr 28, 2020 | 【GAMES101-现代计算机图形学课程笔记】Lecture 07 Shading (着色&漫反射) |
| Apr 26, 2020 | 【GAMES101-现代计算机图形学课程笔记】Lecture 06 光栅化 2 (反走样) |
| Apr 26, 2020 | 【GAMES101-现代计算机图形学课程笔记】Lecture 05 光栅化(三角形) |
| Apr 25, 2020 | 【GAMES101-现代计算机图形学课程笔记】Lecture04 Transformation(续) |
| Apr 25, 2020 | 【GAMES101-现代计算机图形学课程笔记】Lecture 03 Transformation |
| Apr 25, 2020 | 【GAMES101-现代计算机图形学课程笔记】Lecture 02 Linear Algebra |
| Apr 25, 2020 | 【GAMES101-现代计算机图形学课程笔记】Lecture 01 Overview |
| Feb 11, 2020 | 【论文笔记系列】AutoML:A Survey of State-of-the-art (下) |
| Feb 11, 2020 | 【论文笔记系列】AutoML:A Survey of State-of-the-art (上) |
| Jan 28, 2020 | AutoML机器学习公众号 |
| Jan 23, 2020 | 论文笔记系列-DARTS: Differentiable Architecture Search |
| Jan 23, 2020 | 论文笔记系列--P-DARTS |
| Jan 22, 2020 | 论文笔记系列--MnasNet:Platform-Aware NAS for Mobile |
| Dec 31, 2019 | 理解Pytorch中LSTM的输入输出参数含义 |
| Dec 24, 2019 | 将markdown中的Latex公式转换成知乎格式 |
| Dec 24, 2019 | Github Actions教程:运行python代码并Push到远端仓库 |
| Dec 23, 2019 | 常见强化学习方法总结 |
| Dec 22, 2019 | 李宏毅-Network Compression课程笔记 |
| Dec 20, 2019 | 源码详解Pytorch的state_dict和load_state_dict |
| Dec 20, 2019 | 卷积操作转化成矩阵乘法 |
| Dec 18, 2019 | AutoML论文汇总平台,有你的论文吗? |
| Dec 13, 2019 | torchline:让Pytorch使用的更加顺滑 |
| Dec 03, 2019 | 论文笔记系列-AutoFPN |
| Dec 03, 2019 | 机器学习算法推导 第十三章 MCMC |
| Dec 02, 2019 | 机器学习算法推导 第四章 线性分类 |
| Dec 02, 2019 | 机器学习算法推导 第十章 EM算法 |
| Dec 02, 2019 | 机器学习算法推导 第十四章 隐形马尔科夫模型 |
| Dec 02, 2019 | 机器学习算法推导 第十二章 变分推断 |
| Dec 02, 2019 | 机器学习算法推导 第十一章 高斯混合模型 |
| Dec 02, 2019 | 机器学习算法推导 第六章 SVM |
| Dec 02, 2019 | 机器学习算法推导 第八章 指数族分布 |
| Dec 02, 2019 | 机器学习算法推导 第五章 降维 |
| Dec 02, 2019 | 机器学习算法推导 第七章 核方法 |
| Dec 02, 2019 | 机器学习算法推导 一-三 数学基础 线性回归 |
| Nov 23, 2019 | detectron2安装出现Kernel not compiled with GPU support |
| Nov 11, 2019 | 显卡,显卡驱动,nvcc, cuda driver,cudatoolkit,cudnn到底是什么? |
| Oct 23, 2019 | Detectron2源码阅读笔记-(三)Dataset pipeline |
| Oct 15, 2019 | Detectron2源码阅读笔记-(二)Registry&build_*方法 |
| Oct 15, 2019 | Detectron2源码阅读笔记-(一)Config&Trainer |
| Sep 19, 2019 | Pytorch autograd,backward详解 |
| Sep 18, 2019 | Pytorch Sampler详解 |
| Sep 14, 2019 | 论文笔记系列-Auto-DeepLab:Hierarchical NAS |
| Sep 04, 2019 | 如何理解正定矩阵和半正定矩阵 |
| Aug 28, 2019 | 理解相似矩阵 |
| Aug 28, 2019 | 从向量空间的角度来理解方程组有无解的问题 |
| Aug 09, 2019 | AutoML: A Survey of the state-of-the-art |
| Aug 06, 2019 | 一文弄懂Pytorch的DataLoader, DataSet, Sampler之间的关系 |
| Jul 23, 2019 | TensorFlow之estimator详解 |
| Jun 02, 2019 | Pytorch之Dataparallel源码解析 |
| Jan 27, 2019 | 使用python库--Graphviz为论文画出漂亮的示意图 |
| Jan 25, 2019 | 论文笔记系列--iCaRL: Incremental Classifier and Learning |
| Jan 25, 2019 | 欢迎加入AutoML建设! |
| Jan 24, 2019 | 【转载】NeurIPS 2018 | 腾讯AI Lab详解3大热点:模型压缩、机器学习及最优化算法 |
| Jan 21, 2019 | 【转载】论文《Tree-CNN》 增量学习 |
| Jan 17, 2019 | 【转载】AutoML总结 |
| Jan 08, 2019 | 论文笔记系列-NAS With Reinforcement Learning |
| Jan 08, 2019 | AutoML技术现状与未来展望 |
| Jan 05, 2019 | 论文笔记系列-Speeding Up Auto HPO by Extrapolation of LC |
| Jan 03, 2019 | 双调排序Bitonic Sort,适合并行计算的排序算法 |
| Jan 02, 2019 | 贝叶斯优化(Bayesian Optimization)深入理解 |
| Jan 02, 2019 | DeepLearning.ai学习笔记汇总 |
| Jan 02, 2019 | Andrew Ng机器学习课程笔记--汇总 |
| Dec 24, 2018 | 为什么可逆矩阵又叫“非奇异矩阵(non-singular matrix)”? |
| Dec 23, 2018 | 机器学习超参数优化算法-Hyperband |
| Dec 23, 2018 | 【Math for ML】线性代数之——向量空间 |
| Aug 05, 2018 | 无耻的但是肯定会对你有帮助的托福广告 |