Defining and Evaluating Physical Safety for Large Language Models
原始来源文本: Publication signal: Defining and Evaluating Physical Safety for Large Language Models
科技社区情报流
像看英超和懂球帝一样看 AI 与 Biotech:最新论文、科研成果、人物、实验室、证据来源、商业化信号和关系图谱集中在一个信息流里。
原始来源文本: Publication signal: Defining and Evaluating Physical Safety for Large Language Models
原始来源文本: Publication signal: Ground-truthing AI energy consumption: validating CodeCarbon against external measurements
原始来源文本: Publication signal: PsyEval: a comprehensive large language model evaluation benchmark for mental health
原始来源文本: Publication signal: From reactive filtering to proactive moral architecture: rethinking ethical alignment in large language models
原始来源文本: Publication signal: Can AI help reduce prejudice? Evaluating the effectiveness of AI-powered personalized persuasion on support for transgender rights
原始来源文本: Publication signal: Explanations of the Fermi Paradox and the Drake Equation
原始来源文本: Publication signal: AI, Digital Platforms, and the New Systemic Risk
原始来源文本: Publication signal: The 2025 AI Agent Index: Documenting Technical and Safety Features of Deployed Agentic AI Systems
原始来源文本: Publication signal: Strategic Polysemy in AI Discourse: A Philosophical Analysis of Language, Hype, and Power
原始来源文本: Publication signal: AI Alignment and Safety of Large Language Models: A Survey of RLHF, Constitutional AI, Red-Teaming, and Value Learning
原始来源文本: Publication signal: AI Alignment and Safety of Large Language Models: A Survey of RLHF, Constitutional AI, Red-Teaming, and Value Learning
原始来源文本: Publication signal: Off-Centre AI
原始来源文本: Publication signal: Pluralis v0.1: Towards a Multicultural, Multimodal, Multilingual Benchmark for AI Risk and Reliability
原始来源文本: Publication signal: A Prompt-Based AI Safety Evaluation of Gender Bias in Large Language Models: A Comparative Study of ChatGPT and Gemini
原始来源文本: Publication signal: A Prompt-Based AI Safety Evaluation of Gender Bias in Large Language Models: A Comparative Study of ChatGPT and Gemini
原始来源文本: Publication signal: Compliance without coherence: fluent failure and the ethics of alignment evaluation in multi-agent language models
原始来源文本: Publication signal: BEADS: Bias Evaluation Across Domains
原始来源文本: Publication signal: What Does Your AI Mean by "Flourishing"? The Case for Disclosing and Benchmarking the Values in AI Alignment (Preprint)
原始来源文本: Publication signal: Motivation and post-design evaluations of AI usage behind AI-assisted design
原始来源文本: Publication signal: PRINCIPLED FRAMEWORKS FOR AI ALIGNMENT: FROM POST-TRAINING TO INFERENCE